В настоящее время при передаче информации в сотовых сетях связи и передаче речи по Internet (
Принцип предсказания достаточно прост (рис. 10.1).
(рис 10.1) Модель адаптивного предсказания На передающей стороне устанавливается предсказатель, которой по полученной в предыдущий момент информации вырабатывает (предсказывает) последующую информацию. При поступлении информации от передатчика предсказанное и истинное значение сравниваются (вычитаются) и передается ошибка предсказания. В предельном случае, когда предсказание полностью верно, сигнал "ошибка предсказания" равен нулю. На приемном конце устанавливается предсказатель, который, по предыдущей информации, вырабатывает последовательные
Поскольку информация в канале достаточно предсказуема — кодирование с адаптивным предсказанием снижает объем передаваемой по каналу информации.
Наглядным примером предсказания может служить служба передачи поздравительных посланий, которая существовала на телеграфах всего мира.
Если вечером 31 декабря передатчику поступает первоначальное сообщение "Поздравляю…..", то предсказатель с вероятностью 95-98% вырабатывает в следующий момент слова "С Новым годом". Если последующая информация совпадает с предсказанной информацией, то в канал передается сигнал ошибки, равный нулю. На приемном конце будут выработаны те же слова, и при сложении предсказанной информации и значения ошибки пользователю будет передан полный текст. При этом в канале была передана минимальная информация. Если же последующие слова будут "С днем рождения", то соответственно передается
Кодирование с адаптивным предсказанием в настоящее время используется для предсказания формы сигнала, которая имеет достаточно прогнозируемые участки.
Всякое кодирование с предсказанием основывается обычно на аппроксимации формы сигнала, т.е. кодирование кривой с помощью значений этой кривой в отдельных точках и восстановление ее формы на приемном конце по этим отдельным отсчетам.
В математике известны несколько видов аппроксимации. В технике кодирования речи применяется линейная аппроксимация.
При этом способе каждая кривая может быть представлена с произвольной точностью суммой величин предыдущих отсчетов, умноженных на коэффициенты, которые называются коэффициентами предсказания.
Такая аппроксимация отображается с помощью уравнения
$$y(T)=\sum\limits_{t=1}^{p}a_ty(T-t)$$где $$y(T)$$ — отсчет на выходе в следующий момент времени;
$$a_{t}$$ — коэффициент аппроксимации;
$$p$$ — порядок модели.
Чем выше порядок модели, тем точнее она приближается к истинному значению формы кривой.
Предсказание — это генерация последующей формы кривой на основании уравнения отрезков (новых коэффициентов $$a_{t}$$ ). Оно может также основываться на различных принципах.
Самый простой принцип предсказания — это принцип "сохранения предыдущего значения". В этом случае предполагается, что значение предыдущего отсчета сохранится и в последующий момент времени. Так, человек, одеваясь перед выходом из дома, предполагает, что температура на улице сохранится хотя бы на один час. Опровержение этого факта возможно только установлением их разности. Действительно, эксперименты показывают, что разница между предыдущим и последующим значением меньше, чем само значение отсчета. Поэтому для большей части кривой сигнал ошибки может быть не таким значительным.
Приведенная выше формула тогда модифицируется в
$$y(T) = a_{t} y(T - 1)$$
$$a_{t} = 1$$
Тогда в линию передается разность между текущим и предыдущим значениями:
$$\Delta y = y (T) – y(T – 1).$$Обратим внимание, что $$y(T)$$ — аппроксимированное
На рис. 10.2 показана одна из реализаций этого метода.
(рис 10.2) Реализация ДИКМВ данном случае предсказатель представляет собой простой регистр, который накапливает значение предыдущего отсчета. В линию передается разностный сигнал.
Для определения следующего разностного отсчета сигнал восстанавливается в
Разновидностью этого метода является аппроксимирование на основании нескольких отсчетов. Такой способ позволяет увеличить точность аппроксимации, но требует накопления нескольких отсчетов. При этом последующее значение $$y(T)$$ определяется по приведенной выше формуле. При предсказании, основанном на предположении "сохранение предыдущего значения", коэффициенты не меняются, поэтому на приемном конце они те же самые — это позволяет не передавать их по линии, а передать только разность аппроксимированного сигнала.
Эффективность такого кодирования, как было указано выше, оценивается выигрышем от кодирования и измеряется в отношении мощности сигнала, представленного кодами равномерного
При ДИКМ такой выигрыш достигает 5 дБ [10.1]. Однако это значение изменяется от характера сигнала. Система с разностным предсказанием становится неэффективной при большом значении разностного сигнала.
Это может произойти из-за возрастания разности соседних отсчетов или из-за нарушения системы предсказания.
Первое увеличивает количество передаваемой информации. Второе является существенным недостатком систем с предсказанием.
Потеря или искажения значения разностных отсчетов приводят к полному искажению восстанавливаемых значений, поскольку ошибка в предыдущем значении сигнала вызывает катастрофические ошибки в определении последующих.
Все это требует передачи на приемный конец величины выигрыша (для
Это усложняет реализацию, которая показана на рис. 10.3 (
На этих рисунках показаны
Такая схема позволяет периодически проверять качество разностного кодирования и подстраивать коэффициенты аппроксимации. В этом смысле она адаптируема.

(рис 10.4) Кодер с адаптивным предсказанием(рис 10.3) Декодер с адаптивным предсказаниемИмеются методы, основанные на вероятностных методах прогнозирования. При этом последовательные n отсчетов рассматриваются как n случайных величин, и определяется вероятность их совместного появления [10.8] — $$p(x_{1}, …, x_{k})$$. Прогнозирование всего отсчета основано на определении математического ожидания
$$\{M\{y(T)\}=\sum\limits_{y=1}^{p}p_ky(T-t)$$где $$p_{k}$$ — вероятность появления $$k$$ -го отсчета.
При этом в линию передается разность между реальной величиной в момент $$t$$ и его прогнозируемым значением (математическим ожиданием).
$${Y(T) — M{y(T)}$$.
Вероятностные формулы предсказания могут иметь самый различный характер: от формул, предполагающих наличие вероятностного закона, например,
Из всего сказанного можно сделать вывод, что эффективность кодирования с адаптивным предсказанием зависит от сложности адаптивной логики и числа отсчетов для следующего предсказания. Но существует оптимальная точка эффективности предсказания между большим накоплением статистики (осторожная тактика) и быстротой реакции на изменение (тактика быстрого реагирования).
Вычисление коэффициентов предсказания не обязательно проводить в реальном масштабе времени. Их расчет производится на основании математических моделей, исходя из выигрыша от предсказания. Отношение мощности входного сигнала к мощности разностного сигнала называется выигрышем предсказания [10.1].
Поскольку при рассматриваемом методе передачи кодируется разностный сигнал, имеющий меньшую мощность, то такой метод обеспечивает высокий уровень выигрыша предсказания (от 13 до 20 дБ).
Работа вокодера (
(рис 10.5) Пример распределения энергии в частотных диапазонахНа рисунке изображены частотные полосы (от 0 до 1 КГц, от 1 КГц до 2 КГц и т. д.) и распределение энергии по ним при произнесении фразы.
Как видно из рисунка, энергия распределяется во времени только в некоторых частотных диапазонах и различается по величине. Отдельные пики энергии, возникающие в одном частотном диапазоне, называются фонемами.
Эта картина может изменяться в больших диапазонах, в зависимости от тембра голоса и особенностей произношения, но нам сейчас важно рассмотреть общие закономерности построения. На рисунке видно, что буквы отличаются не только частотным диапазоном, но и структурой. Для каждого звука характерны пики (резонансы) энергии в определенных частотных диапазонах и провалы в других. Частоты, на которых в данный момент возникают комбинации пиков (фонем), называются "частотами формант" или просто "формантами". Гласные и звонкие согласные звуки речи содержат обычно от трех до четырех формант. Эти свойства и иллюстрируются рис. 10.5. Изображенная "спектрограмма" представляет распределение энергии речи в виде функции времени и частоты. Горизонтальная ось представляет время, вертикальная — частоту, уровень энергии условно показан частью синусоиды. Периоды между сменами формант составляют от 10 до 30 мс. Изучение образцов речи показало, что в русском языке содержится 42 фонемы: это 6 гласных звуков и остальные согласные [10.5]. Чтобы закодировать их номера, достаточно 6 битов.
Человек в среднем произносит в секунду 10 звуков. То есть от центральной нервной системы к речевому аппарату сигналы передаются со скоростью $$10 [log2 42] = 60 бит/с$$. Это вычисление порождает иллюзию, что речь имеет небольшой объем информации и может быть передана с небольшой скоростью. Однако если рассмотреть подробнее, как образуется звук, то можно обнаружить, что при передаче речи требуется передать больше информации. При разговоре грудная клетка сжимается и расширяется, поток воздуха проходит через трахею и гортань в полости глотки, рта и носа. Голосовой тракт простирается от голосовой щели (отверстие между голосовыми складками гортани) до губ и в процессе речи его форма меняется. Если произносятся звонкие звуки (гласные, носовые, звонкие согласные), называемые также вокализованными (
При произнесении глухих невокализированных (unvoiced) звуков голосовые связки расслаблены. Проходя по суженному голосовому тракту, воздух создает турбулентный поток (завихрение), т.е. в полости рта и носа возбуждаются шумоподобные сигналы. Взрывные (смычные, stop) звуки получаются путем кратковременного выхлопа — полного перекрытия речевого тракта, нагнетания давления и внезапного открытия тракта. Взрывные звуки бывают звонкие (б, д, г) и глухие (п, т, к), т.е. могут образовываться с участием голосовых складок и без них. Таким образом, в терминах спектра сигналов, когда человек говорит, он производит спектральновременную
Эта модель представляет речь человека, который "гудит" на одной частоте, периодически изменяя ее на другую и меняя громкость, а основная информация "добавляется" в "подтонах".
Рассматриваемые ранее принципы и реализующая их аппаратура были предназначены в первую очередь для воспроизведения формы входного сигнала на приеме как можно точнее в форму сигнала на выходе приемной стороны. Ниже рассмотрим принципы построения аппаратуры, которая моделирует человеческую речь, используя при этом методы цифрового кодирования. Они называются вокодеры (это слово получено объединением двух английских слов
По принципу определения параметров фильтровой функции различают следующие типы вокодеров:
Ранее вокодеры выполнялись только на основе аналоговой техники на протяжении всего разговорного тракта. Теперь наиболее распространена цифровая техника.
На рис. 10.6 и рис. 10.7 показан полосовой (канальный) вокодер [10.6, 10.7]. Основная задача процесса кодирования в вокодере — определить спектр сигнала, мощности в каждом диапазоне частот за достаточно длинный отрезок времени, в который существует форманта. На передающей стороне
Полученная информация передается на приемный конец, где она используется для управления цифровым генератором. Он представляет память, где хранятся временные отсчеты частот, из которых необходимо выбрать нужную по частоте и мощности. Возбуждение гласных происходит с помощью
Ортогональные вокодеры отличаются от полосовых тем, что функции фильтров выполняются с помощью цифровых методов. Это либо быстрое преобразование Фурье, либо ортогональные функции Уолша (периодические дискретные функции, принимающие значения 0 или 1) [10.5].

(рис 10.7) Схема полосового кодера(рис 10.6) Схема полосового декодера
Как видно из рис. 10.7, энергия речи может концентрироваться в трех-четырех пиках, называемых формантами. Формантный вокодер определяет и передает положение пика энергии в частотном диапазоне, амплитуду спектральных пиков. Вследствие этого снижается объем передаваемой информации. Качество восстановленной речи зависит от точности определения этих параметров. Принцип устройства формантного вокодера основан, так же как и в предыдущем случае, на разделении спектра на полосы и в определении в полосах необходимых характеристик. Но для передачи отбираются только данные о возбужденных спектрах. Это снижает требования к объему передаваемой информации. Декодер восстанавливает сигнал также с помощью генерации основного тона и различных типов сигналов (шумовых и импульсных). Такой тип вокодера обеспечивает передачу речи со скоростью до 1 Кбит/с, но применяется сравнительно редко из-за больших трудностей, связанных с точным вычислением формант.
Этот тип вокодера (рис. 10.8, рис. 10.9), в отличие от предыдущих типов, для передачи речи применяет не фильтры, а систему линейного предсказания. Как уже упоминалось (рис. 10.1), в линию передается разностный сигнал между истинным и предсказанным значениями. Коэффициенты предсказания [10.8] используются для предсказания управлением, восстанавливающим генератором на приеме и добавления генератором шума для передачи глухих и "свистящих" согласных.

(рис 10.9) Схема передающей части вокодера с линейным предсказанием(рис 10.8) Схема приемной части вокодера с линейным предсказаниемПрямое использование предсказания позволяет воспроизводить звук, но с плохим качеством. ( Качество оценивается в соответствии с методиками, рассмотренными в главе 1.) Поэтому этот метод имеет много различных разновидностей, улучшающих это качество. Эти методы касаются улучшения параметров возбуждения генераторов на приемном конце. Поэтому из трех составляющих системы с предсказанием — аппроксимации, предсказания и методов восстановления (возбуждения генераторов) речи — все усовершенствования метода линейного предсказания касаются последней составляющей. Поэтому они иногда называются гибридными
Многоимпульсное кодирование (MPLPC — Multi-
Линейное предсказание с возбуждением усеченного остаточного сигнала (RELP LTP —
Линейное предсказание с кодовым возбуждением (
Данный класс речевых
Существует большое число разновидностей кодовых книг, которые классифицируются:
Алгоритм
(рис 10.10) Структурная схема кодера CELPМногие из технологий, использующих методы предсказания и вокодерные принципы преобразования, стандартизированы
Ниже приводится табл. 10.1, которая позволяет сравнить качество методов при различных типах
При том заметим, что:
где $$N_{1}$$ — число правильных ответов;
$$N_{2}$$ — число неверных ответов.
Оценка качества проводится по следующей таблице (табл. 10.1).
| Оценка в % | |
|---|---|
| 95-100 | Превосходно |
| 87-95 | Хорошо |
| 79-87 | Удовлетворительно |
| 70-79 | Плохо |
| Менее 70 | Неудовлетворительно |
В таблице 10.2 приводятся результаты оценки различных
| скорость кодирования, кбит/с | метод оценки | |||
|---|---|---|---|---|
| Диагностический рифмованный тест | Диагностический критерий пригодности | |||
| ИКМ | 64 | 95 | 73 | 4,3 |
| QCLEP-13 | 14,4 | 4,2 | ||
| АДИКМ | 32 | 94 | 4,1 | |
| 16 | 94 | 4,0 | ||
| 6,4 | 3,9/3,4** | |||
| RPE-LTP ( |
13 | 3,5 | ||
| MPLPC (Skyphone) | 9,6 | 3,4 | ||
| QCELP | 9,6 | 3,4 | ||
| 8 | 93 | 68 | 3,7 | |
| 2,4 | 90 | 54 | 2,5 | |
Это может произойти из-за возрастания разности соседних отсчетов или из-за нарушения системы предсказания.
Преположим:
| -2,0 | -1,5 | -1,0 | -0,5 | +0,5 | +1,0 | +1,5 | +2,0 | |
| -2,0 | 0,05 | 0,15 | 0,30 | 0,15 | 0,15 | 0,05 | 0,1 | 0,05 |
| -1,5 | 0,15 | 0,05 | 0,3 | 0,15 | 0,15 | 0,05 | 0,1 | 0,05 |
| -1,0 | 0,1 | 0,3 | 0,15 | 0,2 | 0,15 | 0,05 | 0,1 | 0,05 |
| -0,5 | 0,05 | 0,05 | 0,15 | 0,15 | 0,3 | 0,15 | 0,1 | 0,05 |
| +0,5 | 0,05 | 0,05 | 0,05 | 0,15 | 0,15 | 0,3 | 0,2 | 0,05 |
| +1,0 | 0,05 | 0,1 | 0,05 | 0,15 | 0,2 | 0,05 | 0,3 | 0,1 |
| +1,5 | 0,05 | 0,1 | 0,05 | 0,1 | 0,1 | 0,25 | 0,05 | 0,3 |
| +2,0 | 0,05 | 0,05 | 0,05 | 0,15 | 0,15 | 0,3 | 0,2 | 0,05 |
Определите сигналы, передаваемые в сдучае поступления последовательности показанной в табл. 10.4.
| момент времени | Уровень сигнала |
|---|---|
| $$t_{1}$$ | -1,5 |
| $$t_{2}$$ | -1,5 |
| $$t_{3}$$ | -0,5 |
| $$t_{4}$$ | +1,0 |
| $$t_{5}$$ | +1,5 |
| $$t_{6}$$ | +2,0 |
Пример:
Пусть предыдущий сигнал был равен $$-2,0$$.
Определите сигнал, передаваемый в линию.
Определим величину математическое ожидание поступления следующего сигнала.
-2,0 -1,5 -1,0 -0,5 +0,5 +1,0 +1,5 +2,0 -2,0 0,05 0,15 0,30 0,15 0,15 0,05 0,1 0,05$$M (x) = (-2,0) \times 0,05 + (-1,5) \times 0,15 + (-1,0) \times 0,30 + \\+(-0,5) \times 0,15 + (0,5) \times 0,15 + (1,0) \times 0,05 + (1,5) \times \\0,1 + (2,0) \times 0,05 = -0,1 - 0,225 — 0,3 — 0,075 + \\+0,075 + 0,05 + 0,15 + 0,1 = -0,0325$$
Пусть поступает следующий сигнал $$( —1,0)$$. Тогда в линию переадется сигнал равный
$$Y(x) — M(x)=- 0,625$$.
В линию передается этот сигнал $$—0,625$$.
Используя данные таблицы 10.5, определите значение выходного сигнала, используя формулу
$$y(T)=\sum\limits_{t=1}^{p}a_ty(T-t)$$где
$$y(T)$$ — отсчет на выходе в следующий момент времени;
$$a_{t}$$ — коэффициент аппроксимации;
$$p$$ — порядок модели.
| моменты времени | коэффициенты аппроксимации | |||||||
|---|---|---|---|---|---|---|---|---|
| $$Y(t_{1})$$ | $$Y(t_{2})$$ | $$Y(t_{3})$$ | $$Y(t_{4})$$ | $$Y(t_{5})$$ | $$Y(t_{6})$$ | $$Y(t_{7})$$ | $$Y(t_{8})$$ | |
| $$t_{1}$$ | 0,3 | 0,3 | 0,4 | |||||
| $$t_{2}$$ | 0,2 | 0,2 | 0,6 | |||||
| $$t_{3}$$ | 0,15 | 0,1 | 0,75 | |||||
| $$t_{4}$$ | 0,2 | 0,5 | 0,3 | |||||
| $$t_{5}$$ | 0,5 | 0,2 | 0,3 | |||||
| $$t_{6}$$ | 0,3 | 0,3 | 0,4 | |||||
| $$t_{7}$$ | 0,15 | 0,15 | 0,7 | |||||
| $$t_{8}$$ | 0,2 | 0,2 | 0,6 | |||||
В настоящее время при передаче информации в сотовых сетях связи и передаче речи по Internet (
Принцип предсказания достаточно прост (рис. 10.1).
(рис 10.1) Модель адаптивного предсказания На передающей стороне устанавливается предсказатель, которой по полученной в предыдущий момент информации вырабатывает (предсказывает) последующую информацию. При поступлении информации от передатчика предсказанное и истинное значение сравниваются (вычитаются) и передается ошибка предсказания. В предельном случае, когда предсказание полностью верно, сигнал "ошибка предсказания" равен нулю. На приемном конце устанавливается предсказатель, который, по предыдущей информации, вырабатывает последовательные
Поскольку информация в канале достаточно предсказуема — кодирование с адаптивным предсказанием снижает объем передаваемой по каналу информации.
Наглядным примером предсказания может служить служба передачи поздравительных посланий, которая существовала на телеграфах всего мира.
Если вечером 31 декабря передатчику поступает первоначальное сообщение "Поздравляю…..", то предсказатель с вероятностью 95-98% вырабатывает в следующий момент слова "С Новым годом". Если последующая информация совпадает с предсказанной информацией, то в канал передается сигнал ошибки, равный нулю. На приемном конце будут выработаны те же слова, и при сложении предсказанной информации и значения ошибки пользователю будет передан полный текст. При этом в канале была передана минимальная информация. Если же последующие слова будут "С днем рождения", то соответственно передается
Кодирование с адаптивным предсказанием в настоящее время используется для предсказания формы сигнала, которая имеет достаточно прогнозируемые участки.
Всякое кодирование с предсказанием основывается обычно на аппроксимации формы сигнала, т.е. кодирование кривой с помощью значений этой кривой в отдельных точках и восстановление ее формы на приемном конце по этим отдельным отсчетам.
В математике известны несколько видов аппроксимации. В технике кодирования речи применяется линейная аппроксимация.
При этом способе каждая кривая может быть представлена с произвольной точностью суммой величин предыдущих отсчетов, умноженных на коэффициенты, которые называются коэффициентами предсказания.
Такая аппроксимация отображается с помощью уравнения
$$y(T)=\sum\limits_{t=1}^{p}a_ty(T-t)$$где $$y(T)$$ — отсчет на выходе в следующий момент времени;
$$a_{t}$$ — коэффициент аппроксимации;
$$p$$ — порядок модели.
Чем выше порядок модели, тем точнее она приближается к истинному значению формы кривой.
Предсказание — это генерация последующей формы кривой на основании уравнения отрезков (новых коэффициентов $$a_{t}$$ ). Оно может также основываться на различных принципах.
Самый простой принцип предсказания — это принцип "сохранения предыдущего значения". В этом случае предполагается, что значение предыдущего отсчета сохранится и в последующий момент времени. Так, человек, одеваясь перед выходом из дома, предполагает, что температура на улице сохранится хотя бы на один час. Опровержение этого факта возможно только установлением их разности. Действительно, эксперименты показывают, что разница между предыдущим и последующим значением меньше, чем само значение отсчета. Поэтому для большей части кривой сигнал ошибки может быть не таким значительным.
Приведенная выше формула тогда модифицируется в
$$y(T) = a_{t} y(T - 1)$$
$$a_{t} = 1$$
Тогда в линию передается разность между текущим и предыдущим значениями:
$$\Delta y = y (T) – y(T – 1).$$Обратим внимание, что $$y(T)$$ — аппроксимированное
На рис. 10.2 показана одна из реализаций этого метода.
(рис 10.2) Реализация ДИКМВ данном случае предсказатель представляет собой простой регистр, который накапливает значение предыдущего отсчета. В линию передается разностный сигнал.
Для определения следующего разностного отсчета сигнал восстанавливается в
Разновидностью этого метода является аппроксимирование на основании нескольких отсчетов. Такой способ позволяет увеличить точность аппроксимации, но требует накопления нескольких отсчетов. При этом последующее значение $$y(T)$$ определяется по приведенной выше формуле. При предсказании, основанном на предположении "сохранение предыдущего значения", коэффициенты не меняются, поэтому на приемном конце они те же самые — это позволяет не передавать их по линии, а передать только разность аппроксимированного сигнала.
Эффективность такого кодирования, как было указано выше, оценивается выигрышем от кодирования и измеряется в отношении мощности сигнала, представленного кодами равномерного
При ДИКМ такой выигрыш достигает 5 дБ [10.1]. Однако это значение изменяется от характера сигнала. Система с разностным предсказанием становится неэффективной при большом значении разностного сигнала.
Это может произойти из-за возрастания разности соседних отсчетов или из-за нарушения системы предсказания.
Первое увеличивает количество передаваемой информации. Второе является существенным недостатком систем с предсказанием.
Потеря или искажения значения разностных отсчетов приводят к полному искажению восстанавливаемых значений, поскольку ошибка в предыдущем значении сигнала вызывает катастрофические ошибки в определении последующих.
Все это требует передачи на приемный конец величины выигрыша (для
Это усложняет реализацию, которая показана на рис. 10.3 (
На этих рисунках показаны
Такая схема позволяет периодически проверять качество разностного кодирования и подстраивать коэффициенты аппроксимации. В этом смысле она адаптируема.

(рис 10.4) Кодер с адаптивным предсказанием(рис 10.3) Декодер с адаптивным предсказаниемИмеются методы, основанные на вероятностных методах прогнозирования. При этом последовательные n отсчетов рассматриваются как n случайных величин, и определяется вероятность их совместного появления [10.8] — $$p(x_{1}, …, x_{k})$$. Прогнозирование всего отсчета основано на определении математического ожидания
$$\{M\{y(T)\}=\sum\limits_{y=1}^{p}p_ky(T-t)$$где $$p_{k}$$ — вероятность появления $$k$$ -го отсчета.
При этом в линию передается разность между реальной величиной в момент $$t$$ и его прогнозируемым значением (математическим ожиданием).
$${Y(T) — M{y(T)}$$.
Вероятностные формулы предсказания могут иметь самый различный характер: от формул, предполагающих наличие вероятностного закона, например,
Из всего сказанного можно сделать вывод, что эффективность кодирования с адаптивным предсказанием зависит от сложности адаптивной логики и числа отсчетов для следующего предсказания. Но существует оптимальная точка эффективности предсказания между большим накоплением статистики (осторожная тактика) и быстротой реакции на изменение (тактика быстрого реагирования).
Вычисление коэффициентов предсказания не обязательно проводить в реальном масштабе времени. Их расчет производится на основании математических моделей, исходя из выигрыша от предсказания. Отношение мощности входного сигнала к мощности разностного сигнала называется выигрышем предсказания [10.1].
Поскольку при рассматриваемом методе передачи кодируется разностный сигнал, имеющий меньшую мощность, то такой метод обеспечивает высокий уровень выигрыша предсказания (от 13 до 20 дБ).
Работа вокодера (
(рис 10.5) Пример распределения энергии в частотных диапазонахНа рисунке изображены частотные полосы (от 0 до 1 КГц, от 1 КГц до 2 КГц и т. д.) и распределение энергии по ним при произнесении фразы.
Как видно из рисунка, энергия распределяется во времени только в некоторых частотных диапазонах и различается по величине. Отдельные пики энергии, возникающие в одном частотном диапазоне, называются фонемами.
Эта картина может изменяться в больших диапазонах, в зависимости от тембра голоса и особенностей произношения, но нам сейчас важно рассмотреть общие закономерности построения. На рисунке видно, что буквы отличаются не только частотным диапазоном, но и структурой. Для каждого звука характерны пики (резонансы) энергии в определенных частотных диапазонах и провалы в других. Частоты, на которых в данный момент возникают комбинации пиков (фонем), называются "частотами формант" или просто "формантами". Гласные и звонкие согласные звуки речи содержат обычно от трех до четырех формант. Эти свойства и иллюстрируются рис. 10.5. Изображенная "спектрограмма" представляет распределение энергии речи в виде функции времени и частоты. Горизонтальная ось представляет время, вертикальная — частоту, уровень энергии условно показан частью синусоиды. Периоды между сменами формант составляют от 10 до 30 мс. Изучение образцов речи показало, что в русском языке содержится 42 фонемы: это 6 гласных звуков и остальные согласные [10.5]. Чтобы закодировать их номера, достаточно 6 битов.
Человек в среднем произносит в секунду 10 звуков. То есть от центральной нервной системы к речевому аппарату сигналы передаются со скоростью $$10 [log2 42] = 60 бит/с$$. Это вычисление порождает иллюзию, что речь имеет небольшой объем информации и может быть передана с небольшой скоростью. Однако если рассмотреть подробнее, как образуется звук, то можно обнаружить, что при передаче речи требуется передать больше информации. При разговоре грудная клетка сжимается и расширяется, поток воздуха проходит через трахею и гортань в полости глотки, рта и носа. Голосовой тракт простирается от голосовой щели (отверстие между голосовыми складками гортани) до губ и в процессе речи его форма меняется. Если произносятся звонкие звуки (гласные, носовые, звонкие согласные), называемые также вокализованными (
При произнесении глухих невокализированных (unvoiced) звуков голосовые связки расслаблены. Проходя по суженному голосовому тракту, воздух создает турбулентный поток (завихрение), т.е. в полости рта и носа возбуждаются шумоподобные сигналы. Взрывные (смычные, stop) звуки получаются путем кратковременного выхлопа — полного перекрытия речевого тракта, нагнетания давления и внезапного открытия тракта. Взрывные звуки бывают звонкие (б, д, г) и глухие (п, т, к), т.е. могут образовываться с участием голосовых складок и без них. Таким образом, в терминах спектра сигналов, когда человек говорит, он производит спектральновременную
Эта модель представляет речь человека, который "гудит" на одной частоте, периодически изменяя ее на другую и меняя громкость, а основная информация "добавляется" в "подтонах".
Рассматриваемые ранее принципы и реализующая их аппаратура были предназначены в первую очередь для воспроизведения формы входного сигнала на приеме как можно точнее в форму сигнала на выходе приемной стороны. Ниже рассмотрим принципы построения аппаратуры, которая моделирует человеческую речь, используя при этом методы цифрового кодирования. Они называются вокодеры (это слово получено объединением двух английских слов
По принципу определения параметров фильтровой функции различают следующие типы вокодеров:
Ранее вокодеры выполнялись только на основе аналоговой техники на протяжении всего разговорного тракта. Теперь наиболее распространена цифровая техника.
На рис. 10.6 и рис. 10.7 показан полосовой (канальный) вокодер [10.6, 10.7]. Основная задача процесса кодирования в вокодере — определить спектр сигнала, мощности в каждом диапазоне частот за достаточно длинный отрезок времени, в который существует форманта. На передающей стороне
Полученная информация передается на приемный конец, где она используется для управления цифровым генератором. Он представляет память, где хранятся временные отсчеты частот, из которых необходимо выбрать нужную по частоте и мощности. Возбуждение гласных происходит с помощью
Ортогональные вокодеры отличаются от полосовых тем, что функции фильтров выполняются с помощью цифровых методов. Это либо быстрое преобразование Фурье, либо ортогональные функции Уолша (периодические дискретные функции, принимающие значения 0 или 1) [10.5].

(рис 10.7) Схема полосового кодера(рис 10.6) Схема полосового декодера
Как видно из рис. 10.7, энергия речи может концентрироваться в трех-четырех пиках, называемых формантами. Формантный вокодер определяет и передает положение пика энергии в частотном диапазоне, амплитуду спектральных пиков. Вследствие этого снижается объем передаваемой информации. Качество восстановленной речи зависит от точности определения этих параметров. Принцип устройства формантного вокодера основан, так же как и в предыдущем случае, на разделении спектра на полосы и в определении в полосах необходимых характеристик. Но для передачи отбираются только данные о возбужденных спектрах. Это снижает требования к объему передаваемой информации. Декодер восстанавливает сигнал также с помощью генерации основного тона и различных типов сигналов (шумовых и импульсных). Такой тип вокодера обеспечивает передачу речи со скоростью до 1 Кбит/с, но применяется сравнительно редко из-за больших трудностей, связанных с точным вычислением формант.
Этот тип вокодера (рис. 10.8, рис. 10.9), в отличие от предыдущих типов, для передачи речи применяет не фильтры, а систему линейного предсказания. Как уже упоминалось (рис. 10.1), в линию передается разностный сигнал между истинным и предсказанным значениями. Коэффициенты предсказания [10.8] используются для предсказания управлением, восстанавливающим генератором на приеме и добавления генератором шума для передачи глухих и "свистящих" согласных.

(рис 10.9) Схема передающей части вокодера с линейным предсказанием(рис 10.8) Схема приемной части вокодера с линейным предсказаниемПрямое использование предсказания позволяет воспроизводить звук, но с плохим качеством. ( Качество оценивается в соответствии с методиками, рассмотренными в главе 1.) Поэтому этот метод имеет много различных разновидностей, улучшающих это качество. Эти методы касаются улучшения параметров возбуждения генераторов на приемном конце. Поэтому из трех составляющих системы с предсказанием — аппроксимации, предсказания и методов восстановления (возбуждения генераторов) речи — все усовершенствования метода линейного предсказания касаются последней составляющей. Поэтому они иногда называются гибридными
Многоимпульсное кодирование (MPLPC — Multi-
Линейное предсказание с возбуждением усеченного остаточного сигнала (RELP LTP —
Линейное предсказание с кодовым возбуждением (
Данный класс речевых
Существует большое число разновидностей кодовых книг, которые классифицируются:
Алгоритм
(рис 10.10) Структурная схема кодера CELPМногие из технологий, использующих методы предсказания и вокодерные принципы преобразования, стандартизированы
Ниже приводится табл. 10.1, которая позволяет сравнить качество методов при различных типах
При том заметим, что:
где $$N_{1}$$ — число правильных ответов;
$$N_{2}$$ — число неверных ответов.
Оценка качества проводится по следующей таблице (табл. 10.1).
| Оценка в % | |
|---|---|
| 95-100 | Превосходно |
| 87-95 | Хорошо |
| 79-87 | Удовлетворительно |
| 70-79 | Плохо |
| Менее 70 | Неудовлетворительно |
В таблице 10.2 приводятся результаты оценки различных
| скорость кодирования, кбит/с | метод оценки | |||
|---|---|---|---|---|
| Диагностический рифмованный тест | Диагностический критерий пригодности | |||
| ИКМ | 64 | 95 | 73 | 4,3 |
| QCLEP-13 | 14,4 | 4,2 | ||
| АДИКМ | 32 | 94 | 4,1 | |
| 16 | 94 | 4,0 | ||
| 6,4 | 3,9/3,4** | |||
| RPE-LTP ( |
13 | 3,5 | ||
| MPLPC (Skyphone) | 9,6 | 3,4 | ||
| QCELP | 9,6 | 3,4 | ||
| 8 | 93 | 68 | 3,7 | |
| 2,4 | 90 | 54 | 2,5 | |
Это может произойти из-за возрастания разности соседних отсчетов или из-за нарушения системы предсказания.
Преположим:
| -2,0 | -1,5 | -1,0 | -0,5 | +0,5 | +1,0 | +1,5 | +2,0 | |
| -2,0 | 0,05 | 0,15 | 0,30 | 0,15 | 0,15 | 0,05 | 0,1 | 0,05 |
| -1,5 | 0,15 | 0,05 | 0,3 | 0,15 | 0,15 | 0,05 | 0,1 | 0,05 |
| -1,0 | 0,1 | 0,3 | 0,15 | 0,2 | 0,15 | 0,05 | 0,1 | 0,05 |
| -0,5 | 0,05 | 0,05 | 0,15 | 0,15 | 0,3 | 0,15 | 0,1 | 0,05 |
| +0,5 | 0,05 | 0,05 | 0,05 | 0,15 | 0,15 | 0,3 | 0,2 | 0,05 |
| +1,0 | 0,05 | 0,1 | 0,05 | 0,15 | 0,2 | 0,05 | 0,3 | 0,1 |
| +1,5 | 0,05 | 0,1 | 0,05 | 0,1 | 0,1 | 0,25 | 0,05 | 0,3 |
| +2,0 | 0,05 | 0,05 | 0,05 | 0,15 | 0,15 | 0,3 | 0,2 | 0,05 |
Определите сигналы, передаваемые в сдучае поступления последовательности показанной в табл. 10.4.
| момент времени | Уровень сигнала |
|---|---|
| $$t_{1}$$ | -1,5 |
| $$t_{2}$$ | -1,5 |
| $$t_{3}$$ | -0,5 |
| $$t_{4}$$ | +1,0 |
| $$t_{5}$$ | +1,5 |
| $$t_{6}$$ | +2,0 |
Пример:
Пусть предыдущий сигнал был равен $$-2,0$$.
Определите сигнал, передаваемый в линию.
Определим величину математическое ожидание поступления следующего сигнала.
-2,0 -1,5 -1,0 -0,5 +0,5 +1,0 +1,5 +2,0 -2,0 0,05 0,15 0,30 0,15 0,15 0,05 0,1 0,05$$M (x) = (-2,0) \times 0,05 + (-1,5) \times 0,15 + (-1,0) \times 0,30 + \\+(-0,5) \times 0,15 + (0,5) \times 0,15 + (1,0) \times 0,05 + (1,5) \times \\0,1 + (2,0) \times 0,05 = -0,1 - 0,225 — 0,3 — 0,075 + \\+0,075 + 0,05 + 0,15 + 0,1 = -0,0325$$
Пусть поступает следующий сигнал $$( —1,0)$$. Тогда в линию переадется сигнал равный
$$Y(x) — M(x)=- 0,625$$.
В линию передается этот сигнал $$—0,625$$.
Используя данные таблицы 10.5, определите значение выходного сигнала, используя формулу
$$y(T)=\sum\limits_{t=1}^{p}a_ty(T-t)$$где
$$y(T)$$ — отсчет на выходе в следующий момент времени;
$$a_{t}$$ — коэффициент аппроксимации;
$$p$$ — порядок модели.
| моменты времени | коэффициенты аппроксимации | |||||||
|---|---|---|---|---|---|---|---|---|
| $$Y(t_{1})$$ | $$Y(t_{2})$$ | $$Y(t_{3})$$ | $$Y(t_{4})$$ | $$Y(t_{5})$$ | $$Y(t_{6})$$ | $$Y(t_{7})$$ | $$Y(t_{8})$$ | |
| $$t_{1}$$ | 0,3 | 0,3 | 0,4 | |||||
| $$t_{2}$$ | 0,2 | 0,2 | 0,6 | |||||
| $$t_{3}$$ | 0,15 | 0,1 | 0,75 | |||||
| $$t_{4}$$ | 0,2 | 0,5 | 0,3 | |||||
| $$t_{5}$$ | 0,5 | 0,2 | 0,3 | |||||
| $$t_{6}$$ | 0,3 | 0,3 | 0,4 | |||||
| $$t_{7}$$ | 0,15 | 0,15 | 0,7 | |||||
| $$t_{8}$$ | 0,2 | 0,2 | 0,6 | |||||
Для получения официальных документов о завершении программы дополнительного профессионального образования (удостоверения о повышении квалификации, дипломов о профессиональной переподготовке и MBA) необходимо предоставить:
Внимание! Вы можете не заказывать доставку бумажной версии официального документы, а скачать его в электронном виде и распечатать самостоятельно. Информация о выданном документе в течение 1 месяца загружается в Федеральную информационную систему «Федеральный реестр сведений о документах об образовании и (или) о квалификации, документах об обучении» - ФИС ФРДО.
Доступ на новый сайт осуществляется с использованием адреса электронной почты, который был указан вами при регистрации на "старом". Мы постарались перенести все ваши данные с прежнего ресурса, однако не исключена вероятность потери части информации.
При возникновении проблемы со входом, воспользуйтесь функцией сброса пароля
Если вы обнаружите несоответствия, пожалуйста, сообщите нам.