Синтез речи. Методическое пособие для студентов - часть 3

 

  Главная      Учебники - Разные     Синтез речи. Методическое пособие для студентов

 

поиск по сайту            правообладателям  

 

 

 

 

 

 

 

 

 

 

 

содержание      ..     1      2      3     

 

 

 

Синтез речи. Методическое пособие для студентов - часть 3

 

 

67 

естественности,  диктор  начинает  говорить  то  быстрее,  то  медленнее. 
Подобное явление нередко возникает и при компилятивном синтезе. В таких 
случаях также необходимо исправлять длительность аллофонов. 

Повышение 

основного 

тона 

периодического 

сигнала 

по 

вышеописанному  алгоритму  уменьшает  его  длительность.  Для  её 
восстановления  обычно  используется  повтор  периодов  сигнала.  При  этом 
необходимо  избежать  возникновения  двух  основных  дефектов  снижающих 
качество  синтезированного  сигнала.  Первый  связан  с  тем,  что  при  каждом 
повторе  сбивается  фаза  сигнала  (рис.6.12),  что  выражается  в  характерном 
потрескивании  при  воспроизведении  сигнала.  Второй  связан  с  тем,  что 
многократное повторение одного периода человеческое ухо воспринимает как 
гудение или звон. 

Рис.6.12. Слева - пример корректной стыковки периодов, справа - пример 

некорректной стыковки периодов

 

В  [19]  была  предложена  и  реализована  следующая  схема  повтора 

периодов. Пусть  ,

0,

n

L n

N

 — массив значений левого периода (рис.6.13), а 

,

0,

p

R p

P

 — массив значений правого периода (рис.6.14). 

Рис.6.13. Периоды до удлинения сигнала.

 

Тогда массив значений нового периода, который необходимо вставить 

между правым и левым определяется суперпозицией: 

Рис.6.14. Периоды после удлинения аллофона. Добавленный 

период в центре

1

2

0,

0..

0,

..

,

0

,

,

,

,

..

,

0..

k

k

k

k

k

k

k G

k G

k

k

k

TL

k

G

TR

k

F K

M

TR

TL k

K

TL

L

W

k

G K

TR

R W k

F





 

где 

1

2

1

1

1 cos

,

0

,

1 cos

,

0.. ,

2

2

max(0,

),

min( ,

),

min( ,

).

n

n

n

n

W

n

S

W

n

F

S

F

G

K

N

S

N K

F

P K



 

 

  

Полученный в результате период (рис. 6.11) идеально стыкуется по фазе 

как с правым, так и с левым своим соседом, при этом не является повтором ни 
того, ни другого, что и является необходимым нам решением вышеописанных 
дефектов.  Алгоритм  пригоден  и  для  многократного  повторения,  если  его 
применить последовательно для вставки каждого нового периода. 

Соответственно,  понижение  высоты  основного  тона  периодического 

сигнала вышеизложенным алгоритмом увеличивает его длительность. В этом 
случае, для компенсации (уменьшении длительности) также важно избежать 
сбоя  фазы,  поэтому  используется  аналогичный  подход,  массив  значений 
нового  периода,  который  необходимо  вставить  вместо  имеющихся  двух 
определяется суперпозицией: 

1

2

0,

0

0,

..

,

0

,

,

,

,

,

0..

k

k

k

k

k

k

k P K

k G

k

k

k

TR

k

G

TL

k

F K

M

TR

TL k

K

TR

R

W

k

G

K

TL

L W k

F

 





  

где 

1

2

1

1

1 cos

,

0

,

1 cos

,

0

,

2

2

max(0,

),

min( ,

),

min( ,

).

n

n

n

n

W

n

S

W

n

F

S

F

G

K

P

S

P K

F

N K



 

 

  

6.3.3. 

Алгоритм LP-PSOLA 

Данный  подход  [20]  комбинирует  в  себе  основные  идеи  методов  TD-

PSOLA и SPECINT. Применяется LP модель, изображённую на рис. 6.15, для 
получения сигнала ошибки

 

e n

.

Рис.6.15. Структурная схема блока LP фильтра 

Далее он модифицируется методом, представленным в разделе 6.3.1. И 

в заключение, полученная модифицированная функция ошибки предсказания 

 

e n

используется  для  восстановления  исходного  сигнала  с  новой  частотой

основного тона. 

Формула для вычисления

 

e n

дана в (6.5):

[ ]

[ ]

[

1],

T

e n

s n

a

s n

 

 

(6.5) 

где 

 

1

2

[

1]

1 ,

2 ,

,

,

,

,

,

.

T

T

P

s n

s n

s n

s n

P

a

a a

a

 

  

Результирующий  вектор  коэффициентов  линейного  предсказания 

вычисляется по формуле

 

   

1

1

,

n

a

R

n

p n

 

(6.6) 

где 

     

   

1

0

0

1

1

1 ,

1

.

n

n

i

i

R

n

s i

s i

p n

s i

s i

 

 

  

Значения 

 

p n

 в выражении (6.6) можно вычислить рекурсивно, для того

чтобы  избежать  дополнительных  накладных  вычислительных  расходов,  как 
показано в формуле (6.7): 

       

1

1

p n

s n

s n

p n

 

(6.7) 

Далее,  полученные  LP  коэффициенты  на  этапе  анализа  сигнала, 

применяются в обратном LP фильтре к модифицированной функции ошибки 

 

e n

 для того, чтобы получить модифицированный сигнал 

 

s n

 с желаемой

частотой основного тона, как показано в (6.8): 

   

 

1

T

s n

e n

a

s n

(6.8) 

Общая схема алгоритма представлена на рис. 6.16. Модифицированную 

функцию  ошибки

 

e n

можно  получить  из

 

e n

,  используя  алгоритм  TD-

PSOLA,  как  показано  далее.  LP  модель  определяется  для  каждого  отсчёта 

сигнала

n

, что позволяет добиться плавных переходов с соседними моделями. 

Качество результирующей модели зависит от выбора порядка её порядка

P

После правильного определения меток частоты основного тона

 

m

p

n

и 

периодов  частоты  основного  тона

 

p n

в  исходном  сигнале,  контур  частоты

основного тона может быть модифицирован желаемым образом. С этой целью 
определяются  новые  метки

 

m

p

n

,  соответствующие  значениям  новым

периодом основного тона

 

p n

так, что

     

,

p n

n p n

где

 

n

это  степень  модификации  периода  основного  тона,  который  может

быть 

различным 

для 

естественной 

просодической 

модификации, 

автоматической коррекции частоты основного тона и так далее. 

Рис.6.16.

 

Схема анализа и синтеза нового сигнала с использованием LP-

модели 

Новые  метки  частоты  основного  тона

 

m

p

n

определяются  путём

добавления в интервал

 

p n

отсчётов между двумя соседними метками так, что

метка  частоты  основного  тона  будет  перемещена  в  позицию

 

n p n

,  если

n

 

содержит  метку  (т.е.

 

1,

m

p

n

p n

если

 

1,

m

p n

где  позиция  метки  частоты 

основного тона равна 1). На следующем шаге необходимо соединить каждую 
новую метку частоты основного тона

 

m

p

n

с соответствующим ей ближайшим

пиком в оригинальном сигнале

 

.

m

p n

 Это делается путём непосредственного 

сравнения временных индексов

 

m

p

n

и

 

m

p

n

, как показано на рис. 6.17. 

Рис.6.17.

 

Распределение меток частоты основного тона при модификации 

сигнала: (a) увеличение частоты, (b) уменьшение частоты

 

В  заключение,  для  генерации  итоговой  функции  ошибки,  сигнал 

разбивается на взвешенные окном Хеннинга фрагменты по парам периодов с 
перекрытием в один период, т.е. для каждой метки, начиная с предыдущей и 
заканчивая  следующей.  Данные  сегменты  соединяются  согласно  процедуре 
перекрытия  с  наложением  так,  чтобы  соответствовать  новым  периодам 
частоты основного тона

 

p n

, полученным ранее, как показано на рис. 6.18.

Данный подход так же обладает рядом проблем: аппаратная сложность 

вычисления  LP  коэффициентов  и  обратного  LP-фильтра,  в  сигнале 
возбуждения остаётся информация о голосовом тракте, ведущая к появлению 
непонятных  тембральных  артефактов  при  восстановлении  сигнала  по 
модифицированной функции ошибки. 

Рис.6.18. Получение модифицированного сигнала: (a) увеличение 

частоты, (b) уменьшение частоты

 

6.3

.4. Экспериментальные сравнения 

Рассмотрим  ряд  экспериментов  модификации  частоты  основного  тона 

представленными алгоритмами и сравнение результатов их работы. 

Пример  1. 

Участок  синтезированной  женским  голосом  речи  был 

модифицирован  с

 

2

n

и

 

0.5

n

.  Рис.6.19  демонстрирует  небольшие

участки  исходного  и  модифицированного  сигналов  методами  TD-PSOLA, 
SPECINT  и  LP-PSOLA.  На  рис.6.20  приведены  им  соответствующие 
спектрограммы: 

a) исходный сигнал,
b) модифицированный сигнал методом LP-PSOLA с

 

2

n

,

c) модифицированный сигнал методом SPECINT с

 

2

n

,

d) модифицированный сигнал методом TD-PSOLA с

 

2

n

,

e) модифицированный сигнал методом LP-PSOLA с

 

0.5

n

,

f) модифицированный сигнал методом SPECINT с

 

0.5

n

,

g) модифицированный сигнал методом TD-PSOLA с

 

0.5

n

.

Рис.6.19.Фрагменты сигналов в примере 1 

Исходя из данных на рис.6.19, можно сделать вывод, что все алгоритмы 

работают корректно - пики периодов основного тона становятся дальше или 
ближе друг от друга при модификации с

 

2

n

и

 

0.5

n

соответственно.

Аналогичный  вывод  можно  сделать  и  проанализировав  частотные 

полосы, представленные спектрограммами на рис.6.20. Здесь: 

a) исходный сигнал,
b) модифицированный сигнал методом LP-PSOLA с

 

2

n

,

c) модифицированный сигнал методом SPECINT с

 

2

n

,

d) модифицированный сигнал методом TD-PSOLA с

 

2

n

,

e) модифицированный сигнал методом LP-PSOLA с

 

0.5

n

,

f)

модифицированный сигнал методом SPECINT с

 

0.5

n

,

g)

модифицированный сигнал методом TD-PSOLA с

 

0.5

n

.

Пример  2. 

Вновь  характеристики  частоты  основного  тона  были 

модифицированы  с

 

2

n

и

 

0.5

n

.  Однако  в  данном  примере

использовалась речь,  синтезированная мужским  голосом. Вид  результатов 

во  временной  и  частотной  области  практически  аналогичен  тем,  что 
изображены на рис.6.19 и рис.6.20 соответственно. 

Так же, как и в примере 1, по результатам не сложно определить, что 

частота основного тона модифицирована должным образом. В то время как 
спектральная огибающая осталась неизменной. 

Рис.6.20. Спектрограммы сигналов в примере 1 

Пример  3.

На  рис.6.21  приведено  сравнение  результатов

представленных  методов  во  временной  области  с

 

2

n

на  сигнале  из

предыдущего примера 1. Здесь: 

a) исходный сигнал,
b) модифицированный сигнал методом TD-PSOLA,
c) модифицированный сигнал методом SPECINT,
d) модифицированный сигнал методом LP-PSOLA.

Данный пример иллюстрирует значительные недостатки алгоритма TD-

PSOLA,  которые  заключаются  в  существенной  редукции  энергии  сигнала 
между соединяемыми пиками периодов частоты основного тона при

 

1

n

.

Хотя большие окна анализа могли бы исправить эту проблему, они могли бы 
стать причиной появления ложных пиков в модифицированном сигнале, т.к. 
они  могут  не  полностью  редуцироваться  окнами  анализа.  А  такие  ложные 
пики ведут к грубостям и неестественностям в сигнале.  

Рис.6.21. Фрагменты сигналов в примере 3 

Проведенные  эксперименты  показали,  что  наилучшие  результаты  для 

модификации  частоты  основного  тона  в  диапазоне

 

0.5

2

n

  достигаются

при  использовании  алгоритма  LP-PSOLA.  Преимущество  этого  метода 
заключается в сохранении индивидуальности каждого гортанного импульса. 
Однако,  поскольку  в  сигнале  ошибки  частично  остаётся  формантная 
структура, метод LP-PSOLA не является совершенным и зависит от порядка 
LP фильтра. 

6.4. 

Объединение элементов в единый звуковой поток 

Рассмотрим  обработку  данных  на  данном  этапе  на  примере  пары 

звуковых единиц, не умаляя общности задачи, т.к. на данном этапе происходит 
стыковка  каждой  пары  звуковых  элементов  при  формировании  единого 
звукового потока. 

При конкатенативном синтезе можно выделить следующие типы таких 

пар, требующих различной логики стыковки: 

оба аллофона взяты из одного файла и идут подряд — в этом случае

никакой стыковки вообще не происходит; 

оба аллофона взяты в точных контекстах;

первый  аллофон  взят  в  точном  контексте,  второй  —  в  близком  или

дальнем; 

первый аллофон взят в близком или дальнем контексте, а второй — в

точном; 

оба аллофона взяты в близких/ом (дальних/ем) контекстах.

Каждый из представленных вариантов можно разделить на следующие 

типы, в зависимости от вида аллофона: 

1) невокализованный — невокализованный (C – C);
2) невокализованный — вокализованный (С – V);
3) вокализованный — невокализованный (V – C);
4) вокализованный — вокализованный (V – V).

Основная  задача  выполнения  данного  шага  -  обеспечить  плавность 

переходов  (границ)  между  аллофонами.  Достигается  это  путём  сохранения 
перехода,  который  является  естественным  для  данной  звуковой  единицы  и 
плавным  наложением  одной  звуковой  единицы  на  другую.  Схематично 
данные  операции  представлены  на  рис.6.22  и  6.23  для  вариантов  стыковки 
типа "точный контекст — точный контекст», «близкий (дальний) контекст — 
точный  контекст",  "точный  контекст  —  близкий  (дальний)  контекст" 
соответственно. 

Рис.6.22. Слева - стыковка типа "точный контекст — точный контекст", 

справа - типа "близкий (дальний) контекст — точный контекст"

 

В вариантах стыковки типа "точный — точный" и "точный — близкий" 

для  контекстов  типа  C  –  C,  V  –  C  в  случае  если  длина  невокализованного 
аллофона, содержащего "реальный" переход меньше чем 2/3 длины второго 
(правого) невокализованного аллофона, то перекрытие будет происходить по 
типу "близкий (дальний) — близкий (дальний)". 

При реализации стыковки типа "близкий (дальний) - близкий (дальний) 

контексты"  первый  аллофон  накладывается  на  второй  на  один  период  в 
вокализованном случае и на 20мс - в невокализованном. 

6.5. Звуковые эффекты, используемые при синтезе речи 

Алгоритмы  постобработки  звука  в  системах  синтеза  речи  должны 

удовлетворять следующим требованиям: 

не искажать речевой сигнал;

иметь минимальный набор регулируемых параметров;

небольшой временной ресурс реализации.

Рис.6.23. Стыковка типа " точный контекст — близкий (дальний) 

контекст" 

6.5.1. 

Параметрический эквалайзер 

Большое распространение в области обработки речевых сигналов имеют 

устройства, позволяющие изменять тембр сигнала. Это объясняется тем, что 
частотная  характеристика  сигнала,  особенно  после  модификации,  требует 
коррекции в той или иной степени. Для выравнивания спектральной картины 
необходимы частотные корректоры.  

Наиболее  распространенным  частотным  корректором  является 

эквалайзер.  Он  представляет  собой  многополосный  регулятор  тембра, 
позволяющий 

осуществлять 

одновременную 

и 

взаимонезависимую 

регулировку усиления или ослабления сигнала сразу в нескольких частотных 
полосах. 

Первые  эквалайзеры  были  довольно  простыми  устройствами.  Как 

правило,  это  была  одна  ручка,  при  помощи  которой  можно  было  вырезать 
определенную  часть  высокочастотной  составляющей.  Первый  "серьезный" 
эквалайзер  был  изобретен  Питером  Бэксендалом  (Peter  J  Baxandall).  Его 
эквалайзер предусматривал отдельную регуляцию низких и высоких частот, 
причем  можно  было  делать  как  усиление,  так  и  ослабление.  Регулятор 
оставался в своем среднем положении, если эквализации не требовалось. 

Эквалайзеры делятся на два больших класса - графические эквалайзеры 

и  параметрические  эквалайзеры.  Первые  из  них  являются  многополосными 
регуляторами тембра с фиксированными полосами частот коррекции. В таких 
эквалайзерах имеется возможность регулировать только величину подъема и 
спада  амплитудно-частотной  характеристики  (АЧХ).  Параметрические 
эквалайзеры позволяют регулировать, как ширину, так и усиление/ослабление 

сигнала  в  каждой  полосе.  Это  позволяет  получить  достаточно  вариативную 
геометрию АЧХ. 

При работе с эквалайзером очень важно понимать, что усиление какой-

либо частотной полосы приводит к усилению общего уровня аудио сигнала, и 
чрезмерное усиление полос может зачастую привести к искажениям звукового 
сигнала. В связи с этим ослабление «ненужных» частот зачастую дает более 
качественный результат, нежели усиление «нужных». Поэтому эквалайзером 
следует пользоваться очень аккуратно и не использовать его, если в этом нет 
очевидной  надобности.  Важный  -  диапазон  регулировки.  Он  обычно 
составляет плюс/минус 12 или 15 децибел. Как правило, больше и не требуется 

Золотое правило применения эквалайзера

 - "лучше меньше, да лучше".

Если вам нравится, как звучит речь в необработанном виде, то применение
эквалайзера едва ли сделает ее еще лучше, а вот испортить может вполне.

Второе  правило  -  серебряное

  -  звучит  так:  "Лучше  вычитать,  а  не

добавлять".

Простейшим  для  реализации  в  системе  синтеза  речи  представляется 

трехполосных  параметрический  эквалайзер.  Он  представляет  собой  три 
параллельно включенных фильтра: фильтр нижних частот (ФНЧ), полосовой 
фильтр (ПФ) и фильтр верхних частот (ФВЧ). 

Разбиение спектра на три полосы производится заданием пользователем 

левой и правой частот: 

L

F

 и 

R

F

. В каждой спектральной полосе предусмотрена 

независимая пользовательская регулировка усиления/ослабления: 

,

,

L

C

R

  

Возникает вопрос выбора фильтров для реализации эквалайзера. 

БИХ  фильтры  (фильтры  с  бесконечной  импульсной  характеристикой)
требуют существенно меньших вычислительных затрат при фильтрации
по  сравнению  с  фильтрами  с  конечной  импульсной  характеристикой
(КИХ фильтрами).

Расчет  КИХ  фильтров  более  сложен,  чем  расчет  БИХ  фильтров  с
аналогичными частотными характеристиками.

У  БИХ  фильтров  неизбежны  фазовые  искажения,  существенно
влияющие  на  восприятие  речевого  сигнала.  Их  легко  исключить  при
использовании КИХ фильтров

Возможна неустойчивость работы БИХ фильтра.

КИХ  фильтры,  реализуемые  не  рекурсивно,  т.  е.  с  помощью  прямой
свертки, всегда устойчивы.

Данные  соображения  позволяют  сделать  выбор  в  пользу  реализации 

эквалайзера КИХ фильтрами. На рис.6.24 и 6.25 представлены типовые АЧХ 
(амплитудно-частотная  характеристика  фильтра)  для  ФНЧ  и  полосового 
фильтра (64 коэффициента): 

Рис.6.24. АЧХ для фильтра нижних частот эквалайзера 

Рис.6.25. АЧХ для полосового (центрального) фильтра эквалайзера 

На рис.6.26 представлена схема работы вышеописанного трехполосного 

эквалайзера для системы синтеза речи. 

Рис.6.26. Схема работы трехполосного эквалайзера 

6.5.2. Ревербератор 

Реверберация  (от  латинского  reverberatus,  "повторный  удар")  -  это 

процесс  продолжения  звучания  после  окончания  звукового  импульса  или 
колебания  благодаря  отражениям  звуковых  волн  от  поверхностей.  Поэтому 

ФНЧ 

ПФ 

ФВЧ 

реверберация  имеет  место  только  в  закрытых  помещениях,  хотя  в  особых 
условиях некоторые ее виды могут иметь место и на открытом пространстве 
(например,  узкое  горное  ущелье,  стадион,  городская  площадь  и  т.п.). 
Различные  реализации  ревербераторов  очень  востребованы  у  специалистов, 
занимающихся  обработкой  музыкальных  и  речевых  сигналов.  Эффект 
реверберации проявляется в более сочном гулком объемном звучании, обычно 
более приятном для восприятия, чем исходный «сухой» звук. 

Простейший  ревербератор  для  системы  синтеза  речи  можно 

реализовать, как набор линий задержки 

1

2

,

,

,

N

 

, каждая со своим весовым 

коэффициентом 

i

В реальных условиях эффект реверберации наблюдается не сразу - ведь 

звуковой  волне  первоначально  требуется  какое-то  время  для  того,  чтобы 
достигнуть  отражающей  поверхности  и  возвратиться  обратно.  Линии 
задержки  как  раз  имитируют  этот  процесс.  Типичное  значение  первой 
задержки: 20-50 мс. 

Перед  добавлением  к  исходному  сигналу,  выход  ревербератора 

фильтруется ФНЧ фильтром первого порядка. Желаемое соотношение между 
"сухим"  и  обработанным  сигналом  задается  коэффициентом  применимости 
ревербератора:

(0,1)

Ревербератор  обычно  может  работать  в  двух  режимах:  ручной  и  с 

использованием  готовой  конфигурации.  Для  ручного  режима  регулируется 
первая  (минимальная)  задержка

1

,  а  величины  остальных  задержек 

определяются автоматически: 

1

1

2

, 2

i

N

i

i

N

  

 

  

Практически, ручной режим реализует так называемый эффект задержки 

(«эффект эхо»). 

Режим готовой конфигурации предусматривает использование заранее 

рассчитанных 

параметров, 

имитирующих 

акустическую 

модель 

определенного помещения, например, «закрытая небольшая комната», «зал», 
«открытое пространство» и т.п. В этом случае все параметры задержек 

i

  и 

весовых  коэффициентов 

i

имеют  свои  уникальные  значения.  На  рис.6.27 

приведена схема работы предложенного ревербератора. 

7. СИНТЕЗ, ОСНОВАННЫЙ НА МОДЕЛЯХ

Данный  тип  синтеза  является  гибридом  подходов,  основанных  на 

правилах  и  речевом  корпусе.  В  этом  случае  происходит  описание  звуковой 
базы данных параметрической моделью. Параметры (например, спектральные 
характеристики,  частота  основного  тона,  длительность  и  т.д.)  обобщаются 
множеством  статистических  моделей,  представляющими  собой  скрытые 
марковские модели, которые содержат в себе шаблоны речевых элементов. 

Рис.6.27. Схема работы ревербератора 

Определение  параметров  речевого  сигнала  происходит  на  основе 

критерия максимального правдоподобия применительно к этим моделям. Так 
для модели, имеющей N состояний с M компонентами на состояние и вектор 
наблюдений 

𝐎 = [o

1

, o

2

, … , o

T

]′

,  функция  правдоподобия  наблюдения  o

t

состояния Sj определяется следующим выражением: 

p(o

t

|q

j

= S

j

) = ∑

c

jm

b

jm

(o

t

) = ∑

c

jm

N(o

t

; μ

im

Σ

jm

)

M

m=1

M

m=1

   (7.1) 

Для  модели,  вектор  наблюдения  которой  не  содержит  динамических 

признаков,  т.е.  o

t

=c

t

,  наблюдения,  которые  максимизируют  p(O|λ),  являются 

наиболее вероятной последовательностью: 

p(O|λ) = p(O|Q, λ)P(Q|λ)

(7.2) 

где Q – последовательность состояний и компонент: Q=(q,i), q={q

1

,q

2

,…,q

T

}, 

i={i

1

,i

2

,…,i

T

}. 

После  получения  Q,  максимизация  p(O|λ)  и  p(O|Q,λ)  выполняется 

следующим образом: 

log p(O|Q, λ) = log ∏

b

q

t

,i

t

(o

t

) = −

1
2

(O − μ)

Σ

−1

(O − μ) −

T

t=1

1
2

log|Σ

q

t

|

T

t=1

1
2

TD log(2π)

, (7.3) 

где 

μ = [μ

q

1

,i

1

, μ

q

2

,i

2

, … , μ

q

T

,i

T

]

Σ = diag[Σ

q

1

,i

1

, Σ

q

2

,i

2

, … , Σ

q

T

,i

T

],

T – 

длина последовательности векторов наблюдений в количестве фреймов; D 

– размерность статических векторов параметров.

В выражении 7.3 

log p(O|Q, λ)

 

максимален, если его производная равна 

0:

 

∂(log p(O|Q, λ))

∂с

= −Σ

−1

с + Σ

−1

μ = 0

… 

ФНЧ 

81 

Таким  образом,  максимум  достигается  при  c  =  μ,  т.е.,  другими  словами, 
наиболее  вероятная  получаемая  последовательность  наблюдений  является 
последовательностью векторов средних, независимо от ковариации Σ. 

При  введении  динамических  признаков,  вектор  наблюдений  можно 

определить, как

 

o

t

= [c

t

, ∆c

t

, ∆

2

c

t

]′

,

 где:

(n)

c

t

= ∑ ω

(n)

(τ)c

t+τ

L(n)

τ=−L(n)

 (n = 0,1,2)

 

При  введении  нового  определения  вектора  признаков,  выражение  7.3 

примет следующий вид: 

log p(O|Q, λ) = (O − μ)

Σ

−1

(O − μ) −

1
2

log|Σ| −

3TD

2

log(2π)

 

= (Wc − μ)′ Σ

−1

(Wc − μ) −

1
2

log|Σ| −

3TD

2

log(2π)

 

= e(c) −

1
2

log|Σ| −

3TD

2

log(2π)

 

где: 

 - μ и Σ определяются так же, как и в 7.3; 

e(c) = (Wc − μ)′Σ

−1

(Wc − μ)

;

W = [ω

1

, ω

2

, … , ω

T

]′

;

ω

t

= [ω

t

(0)

, ω

t

(1)

, ω

t

(2)

]

;

ω

t

(n)

= [O

M×M

, … , O

M×M

, ω(n)(−L

(N)

)I

M×M

, … , ω(0)I

M×M

,

… , ω(n)(L

(N)

)I

M×M

, O

M×M

, … , O

M×M

]

Минимизация выполняется следующим образом: 

∂log(O|Q,λ)

∂c

= 0

(W

Σ

−1

W)c − W

Σ

−1

μ = 0

, (7.4)

Выражение 7.4 можно представить в следующем виде: 

Rc = r

где: 

R = W′Σ

−1

W

r = W′Σ

−1

μ

При  решении  данной  задачи  напрямую  требуется  O(T

3

M

3

)  операций, 

однако  существует  более  быстрый  алгоритм,  позволяющий  существенно 
снизить вычислительную сложность вычислений. 

Синтез  речи,  основанный  на  моделях,  представлен  в  системе  HTS, 

являющейся  единственной  открытой  системой.  Также  подобные  системы 
были реализованы в компании Microsoft и Whistler. 

У истоков данного подхода к синтезу речи лежит концепция линейного 

предсказания  значения  текущего  отсчета  на  основе  линейной  комбинации 
набора  предшествующих  ему  отсчетов.  Данная  концепция  предполагает 
расчет коэффициентов авторегрессионного фильтра: 

σ

A

p

(z)

,

A

p

(z) = 1 + ∑ a

k

z

−k

p

k=1

путем минимизации сигнала остатка, который вычисляется путем вычитания 
из  исходного  сигнала  сигнала,  предсказанного  AR  фильтром.  Минимизация 
выполняется путем решения уравнения: 

a

j

φ

x

(i − j) = −φ

x

(i), (i = 1, … , p)

p
j=1

где  p  –  порядок  предсказания,  соответствующий  количеству  резонансных 
частот, порождаемых фильтром, от 0 до половины частоты дискретизации; a

i

 

– коэффициенты линейного предсказания, первый коэффициент  a

0

=1; φ

x

(i) –

значение автокорреляционной функции сигнала x. 

Исходный речевой сигнал получается путем подачи сигнала остатка на 

AR фильтр, параметры которого содержатся в моделях той или иной звуковой 
единицы. 

В  основе  такого  подхода  лежит  упрощенная  модель  человеческого 

вокального  тракта,  где  сигнал  возбуждение  и  форма  вокального  тракта 
моделируются независимо. Предполагается, что функция возбуждения бывает 
двух  типов:  вокализованная,  порождаемая  периодическими  единичными 
импульсами,  моделирующими  открытие  гортани;  невокализованная, 
порождаемая белым шумом, моделирующим шумовые завихрения воздуха в 
гортани.  Стоит  отметить,  что  такая  замена  оригинальной  функции 
возбуждения 

ведет 

к 

существенному 

снижению 

естественности 

синтезированной  речи.  Далее  сигнал  возбуждения  (вокальная  и  шумовая 
составляющие) 

обрабатывается 

дополнительными 

фильтрами, 

моделирующими  вокальный  тракт,  а  именно:  гортань  (G(z)),  носовые  и 
ротовые особенности (V(z)), губы (R(z)), как представлено на рисунке 7.1.

  

Данный набор фильтров можно представить следующим выражением 

G(z)V(z)R(z) =

1

(1−αz

−1

)(1−βz

−1

)

B

(1+b

1,k

z

−1

+b

2,k

z

−2

)

K

k=1

c(1 − z

−1

)

    

σ

A

p

(z)

 (1.5) 

При  моделировании  вокализованной  речи,  количество  коэффициентов 

AR фильтра p следует выбирать, основываясь на следующих соотношениях: 2 
коэффициента  для  формирования  гортанных  искажений,  2  –  на  каждую 

форманту,  которые  условно  распределены  через  каждые  1000  Гц  спектра

Таким  образом,  например,  при  частоте  дискретизации  22050Гц  следует 
выбрать 24-25 коэффициентов.

 

Рис.7.1. Модель речевого тракта

 

По  своей  природе  речевой  сигнал  является  нестационарным.  Однако, 

для применения техники на основе линейного предсказания необходимо иметь 
стационарный сигнал. Для этого речь разбивают на перекрывающиеся между 
собой окна, внутри которых, в силу их небольшой длины, предполагается, что 
сигнал  стационарен.  Выбор  размера  такого  окна  (фрейма)  и  величины 
смещения  напрямую  влияет  на  вычислительную  сложность  алгоритма 
(меньшее смещение фреймов ведет к большему их количеству для обработки) 
и точность извлечения параметров (в зависимости от степени стационарности 
речи на некотором участке, использование большего или меньшего окна ведет 
к более точному вычислению параметров). 

Рис.7.2. Синтез речи на основе линейного предсказания 

На  рисунке  7.2  представлена  общая  схема  генерации  речи  не  основе 

линейного  предсказания:  сигнал  возбуждения,  представленный  либо 
единичными  импульсами  в  случае  вокализованного  фрейма,  либо  белым 
шумом в случае невокализованного фрейма, является входом для AR фильтра, 
моделирующего  вокальный  тракт.  Применение  такой  параметрической 
модели  позволяет  далее  легко  производить  какие-либо  просодические 
модификации. Так, частота основного тона определяется расстоянием между 
последовательными  единичными  импульсами,  которое  может  быть  задано 
требуемым  значением  T.  Для  сохранения  исходной  амплитуды  сигнала 
используется масштабный коэффициент σ

0

, который должен быть заменен на  

σ = σ

0

T

0

T

где

 T

0

 – длина периода исходного сигнала. Длина сигнала модифицируется 

путем дублирования или удаления фреймов. Так же благодаря применению 
параметрической модели, гладкость спектральных характеристик может быть 
достигнута путем линейной интерполяции сегментов. Готовые фреймы 
складываются с перекрытием, формируя итоговый сигнал. 

Главным  недостатком  применения  подхода  на  основе  линейного 

предсказания  является  сильная  роботизированность  голоса.  Эксперименты 
показывают,  что  данный  недостаток  не  может  быть  устранен  путем 
увеличения  порядка  модели.  В  первую  очередь,  отдельное  моделирование 
параметров фильтра и сигнала возбуждения может ухудшить результат, если 
их  характеристики  изменяются  независимо.  Также,  функция  возбуждения, 
которая имеет различную природу для вокализованных и невокализованных 
звуков,  не  может  должным  образом  моделировать  смешанные  звуки,  такие 
как, например, «в». Однако стоит отметить, что последнее можно исправить 
путем применения смешанной функции возбуждения [ссылки на статьи про 
смешанный сигнал возбуждения]. 

По сравнению с методом Unit Selection, подход, в основе которого лежат 

модели речи, имеет следующие преимущества и недостатки. 

1. Автоматическое  обучение  параметров  моделей,  которое  возможно

выполнять  на  относительно  небольшом  речевом  материале,
позволяет существенно сократить объем требуемой памяти, а также
позволяет разрабатывать новый голос за гораздо меньшее время.

2. Речь,  полученная  на  основе  моделей,  более  искусственна,  однако  в

ней не наблюдаются разрывы, присутствующие при конкатенативном
синтезе.  Кроме  того,  при  применении  технологии  Unit  Selection
качество  синтеза  существенно  ухудшается  в  случае  отсутствия
подходящего  звукового  элемента  в  базе  данных.  При  применении
моделей  отсутствующие  в  обучающей  выборке  звуковые  элементы
синтезируются  на  основе  средних  значений,  максимально
приближенных  к  требуемым,  благодаря  применению  технологии
кластеризации  контекстов,  основанной  на  деревьях.  Это  позволяет
добиться разборчивости при ограниченном количестве контекстов.

85 

3.

Синтез,  основанный  на  моделях,  позволяет  легко  модифицировать
характеристики  голоса  путем  применения  адаптации/интерполяции
диктора, в то время как метод  Unit Selection порождает речь, стиль
которой не может быть отличен от стиля, представленного в речевом
корпусе.

В  заключение,  достоинства  и  недостатки  подходов,  основанного  на 

моделях и Unit Selection, можно представить в виде таблицы (таблица 7.1). 

Таблица 7.1. Достоинства и недостатки современных подходов к синтезу 

речи

 

Критерий сравнения 

Подход Unit 

Selection 

Основанный на моделях 

подход 

Сложность создания 

нового голоса 

Высокая 

Невысокая 

Объем требуемой памяти 

Высокий 

Невысокий 

Качество синтезируемой 

речи 

Высокое 

Роботизированная речь 

Ощущение разрывов речи 

Возможно 

Менее вероятно 

Качество синтеза 

элементов, 

отсутствующих в 

звуковом корпусе 

Низкое 

Высокое 

Стиль речи 

Фиксирован 

Может быть 

модифицирован 

В  качестве  схем,  объединяющих  данные  подходы,  могут  применяться 

следующие: генерация физических параметров звуковых элементов на основе 
скрытых  марковских  моделей  для  последующего  вычисления  стоимости 
замены  для  метода  Unit  Selection;  использование  значений  вероятностей 
переходов  как  «стоимости»;  использование  звуковых  элементов,  размер 
которых  сопоставим  с  размером  состояния  модели;  использование 
статистических моделей для вычисления стоимости связи между элементами. 

Сами  по  себе  системы  статистического  моделирования  развиваются 

независимо от систем синтез речи. Они включают в себя такие приложения, 
как кодирование речи, преобразование параметров диктора и «подделку» речи 
диктора в задачах идентификации/верификации. 

ЛИТЕРАТУРА 

1. Брызгунова  Е.А.

 

(1982)  Интонация  //  Русская  грамматика.  Том  1.  М.

Наука. С. 96-122.

2. Фланаган Дж. Анализ, синтез и восприятие речи. М.: Связь, 1968.

86 

3. Taylor  P.  Text-to-Speech  Synthesis.  Cambridge  University  Press,  2009.

474 p.

4. Лобанов Б.М., Цирульник Л. И. Компьютерный синтез и клонирование

речи. Минск, «Белорусская Наука», 2008. 316 с.

5. Hunt A., Black A. Unit Selection in a Concatenative Speech Synthesis System

Using a Large Speech Database// Proceedings of ICASSP 96, 1996, pp. 373-
376. 

6. Tokuda  K.,  Masuko  T.,  Yamada  T.  An  algorithm  for  speech  parameter

generation  from  continuous  mixture  HMMs  with  dynamic  features  //
Proceedings of Eurospeech-1995, 1995.

7. Loh  W.-Y.  Classification  and  Regression  Tree  Methods  //  Encyclopedia  of

Statistics in Quality and Reliability, Wiley. 2008. P. 315-323.

8. Breiman  L.  Cutler

  A.

  Random  Forests  [Электронный  ресурс],  Режим

доступа:
http://www.stat.berkeley.edu/~breiman/RandomForests/cc_home.htm, свобо
-дный. – Загл. с экрана. – Яз. англ.

9. Чистиков  П.Г.,  Хомицевич  О.Г.,  Рыбин  С.В.  Статистические  методы

определения мест и длительностей пауз в системах синтеза речи. Изв.
вузов. 

Приборостроение. 

Тематический 

выпуск 

"Речевые

информационные системы" (в печати).

10. Хомицевич  О.Г.,  Рыбин  С.В.,  Аничкин  И.М.  Использование

лингвистического анализа для нормализации текста и снятия омонимии
в  системе  синтеза  русской  речи.  Изв.  вузов.  Приборостроение.
Тематический выпуск "Речевые информационные системы". 2013. №2.
С. 42-46.

11.

 

Аничкин  И.М.,  Чистиков  П.Г.  Формализация  правил  автоматического
снятия омонимии в системе синтеза речи по тексту // Труды XXXVIII
международной филологической конференции, 2008.

12. Fujisaki  H.  Dynamic  characteristics  of  voice  fundamental  frequency  in

speech and singing // Production of Speech. N.Y. 1983. 

13. Pierrehumbert, J. (1980) The phonology and phonetics of English intonation.

PhD thesis, MIT. Distributed 1988, Indiana University Linguistics Club. 

14. Black A.W., Hunt A.J. Unit Selection in a Concatenative Speech Synthesis

Using  a  Large  Speech  Database  //  In  Proceedings  of  ICASSP  96.  Atlanta, 
Georgia, 1996. Vol. 1, pp. 373-376. 

15. Conkie A.  A  robust  unit  selection  system  for  speech  synthesis  //  In

Proceedings of Joint Meeting of  ASA, EAA and DAGA. Berlin, Germany, 
1999. Paper 1PSCB-10.

 

16. Vepa J.  Join  Cost  for  Unit  Selection  Speech  Synthesis.  University  of

Edinburgh, 2004.

 

17. Чистиков П.Г., Рыбин С.В. "Проблемы естественности речевого сигнала

в  системах  синтеза",  журнал  "Информационные  технологии  в 
образовании", Санкт-Петербург, 2011.

 

87 

18. Moulines E., Verhelst W. "Time-domain and frequency-domain techniques

for  prosodic  modification  of  speech  in  Speech  Coding  and  Synthesis",  pp.
519–555, Netherland, 1995.

19. Главатских  И.А.,  Чистиков  П.Г.  "Метод  модификации  физических

параметров  речевого  сигнала  на  основе  периодосинхронного  Фурье-
анализа", 

труды 

XXXVII 

международной 

филологической 

конференции, формальные методы анализа русской речи, Россия, 2009.

20. Rafael  C. D. de  Paiva, Luiz  W. P. Biscainho  and  Sergio  L.  Netto  "On  the

application  of  RLS  adaptive  filtering  for  voice  pitch  modification",  in 
proceedings of  the 10th  International  Conference on  Digital  Audio  Effects, 
France, 2007.

21. Taylor P. Text-to-Speech Synthesis. Cambridge University Press; 1 edition,

2009.

 

Миссия  университета

  –  генерация  передовых  знаний,  внедрение 

инновационных  разработок  и  подготовка  элитных  кадров,  способных 
действовать  в  условиях  быстро  меняющегося  мира  и  обеспечивать 
опережающее развитие науки, технологий и других областей для содействия 
решению актуальных задач. 

КАФЕДРА РЕЧЕВЫХ ИНФОРМАЦИОННЫХ СИСТЕМ 

О кафедре

 

Кафедра речевых информационных систем (РИС) создана в 2011 году на 

факультете Информационных технологий и программирования (ФИТиП). 

Организатором  создания  кафедры  выступает  «Центр  речевых 

технологий» (www.speechpro.ru). Заведующий – генеральный директор ООО 
«Центр  речевых  технологий»,  кандидат  технических  наук  Хитров  Михаил 
Васильевич, вице-президент консорциума «Российские речевые технологии», 
член ISCA, IEEE. 

Кафедра  РИС  обеспечивает  подготовку  докторантов,  аспирантов  и 

магистров. Для тех, кто имеет высшее образование, но хотел бы связать свое 
будущее  с  речевыми  технологиями,  имеются  курсы  дополнительного 
профессионального образования. 

Обучение на кафедре

 

Кафедра  «Речевые  информационные  системы»  (базовая  кафедра 

«Центра  речевых  технологий»)  Санкт-Петербургского  национального 
исследовательского  университета информационных  технологий, механики и 
оптики (ИТМО) в рамках направления 230400.68 «Информационные системы 
и  технологии»  открывает  прием  в  магистратуру  по  новой  образовательной 
программе 230400.68.04 «Речевые информационные системы». 

Срок  обучения  2  года.  Обучение  завершается  защитой  магистерской 

диссертации. 

Целевая установка магистратуры – подготовка специалистов, способных 

участвовать  в  исследовательской  и  проектной  работе  в  области  речевых 
информационных  технологий  со  специализацией  в  направлениях 
распознавания  и  синтеза  речи,  распознавания  личностей  по  голосу, 
мультимодальной  биометрии,  в  области  проектирования  и  разработки 
информационных систем и программного обеспечения. 

Область  профессиональной  деятельности  выпускников  кафедры  РИС 

включает: 

 

исследование,  разработка,  внедрение  речевых  информационных 

технологий и систем; 

 

методы и алгоритмы цифровой обработки речевых сигналов; 

89 

 

автоматизированные системы обработки речевых сигналов; 

 

программное 

обеспечение 

автоматизированных 

речевых 

информационных систем; 

 

системы  автоматизированного  проектирования  программных  и 

аппаратных средств для речевых информационных систем и информационной 
поддержки таких средств. 

Объектами профессиональной деятельности выпускников кафедры РИС 

являются: 

 

информационные  процессы,  технологии,  системы  и  сети, 

предназначенные для обработки, распознавания, синтеза речевых сигналов; 

 

инструментальное 

(математическое, 

информационное, 

техническое, 

лингвистическое, 

программное, 

эргономическое, 

организационное и правовое) обеспечение речевых информационных систем; 

 

способы  и  методы  проектирования,  отладки,  производства  и 

эксплуатации  информационных  технологий  и  систем  в  областях  обработки, 
распознавания,  синтеза  речевых  сигналов,  телекоммуникации,  связи, 
инфокоммуникации, медицины. 

Широкий  профиль  подготовки,  знание  универсальных  методов 

исследования  и  проектирования  информационных  систем,  практические 
навыки  работы  с  современным  программным  обеспечением  –  все  это 
позволяет  выпускникам  кафедры  найти  работу  в  научных  институтах  и 
университетах,  в  фирмах,  на  производственных  предприятиях,  а  также  в 
коммерческих  структурах.  Студентам,  которые  хорошо  проявляют  себя  в 
учебе, предлагается работа в ООО «Центр речевых технологий». 

Учебный план предусматривает, в частности, следующие курсы: 

 

Информационные технологии: 

 

Системный анализ и моделирование информационных процессов и 

систем; 

 

Проектирование информационных систем; 

 

Организация  проектирования  и  разработки  программного 

обеспечения распределенных систем; 

 

Организация  проектирования  и  разработки  программного 

обеспечения встроенных систем; 

 

Тестирования программного обеспечения; 

 

Управление качеством разработки программного обеспечения. 

Речевые технологии: 

 

Цифровая обработка сигналов; 

 

Цифровая обработка речевых сигналов; 

 

Математическое моделирование и теория принятия решений; 

 

Распознавание образов; 

 

Распознавание и синтез речи; 

 

Распознавание диктора (говорящего по голосу); 

 

Мультимодальные биометрические системы. 

90 

К  преподаванию  привлекаются  ведущие  специалисты  «Центра  речевых 
технологий», преподаватели , а также специалисты, работающие в известных 
научных, производственных и коммерческих организациях.

  

 

 

 

 

 

 

 

содержание      ..     1      2      3