Синтез речи. Методическое пособие для студентов - часть 1

 

  Главная      Учебники - Разные     Синтез речи. Методическое пособие для студентов

 

поиск по сайту            правообладателям  

 

 

 

 

 

 

 

 

 

 

содержание      ..      1       2         ..

 

 

Синтез речи. Методическое пособие для студентов - часть 1

 

 

Оглавление 

ВВЕДЕНИЕ  ______________________________________________________ 5

 

1. СИСТЕМЫ СИНТЕЗА РЕЧИ: ИСТОРИЯ РАЗВИТИЯ, СОВРЕМЕННОЕ

СОСТОЯНИЕ  ____________________________________________________ 6

 

1.1. Первые механические синтезаторы  ___________________________ 6

 

1.2. Первые электрические синтезаторы ___________________________ 9

 

1.3. ХХ век: синтезаторы первого поколения ______________________ 13

 

1.3.1. Артикуляционный синтез  _________________________________ 13 
1.3.2. Формантный синтез ______________________________________ 14 
1.3.3. Синтезаторы, использующие линейное предсказание  __________ 16 

1.4. ХХ век: синтезаторы второго поколения ______________________ 17

 

1.5. ХХ век: синтезаторы третьего поколения _____________________ 18

 

1.5.1. Селективный синтез речи  _________________________________ 18 
1.5.2. Статистический параметрический синтез  ____________________ 19 

1.6. Перспективные направления синтеза_________________________ 19

 

2. ОБЗОР ТЕХНОЛОГИЙ TTS ______________________________________ 20

2.1. Типы синтезаторов _________________________________________ 20

2.1.1. Параметрический синтез __________________________________ 20 
2.1.2. Компилятивный синтез  ___________________________________ 20 
2.1.3. Синтез речи по фонетическим правилам _____________________ 21 

2.2. Оценка качества синтеза речи _______________________________ 21

 

2.3. Структура TTS  ____________________________________________ 23

 

3. ЛИНГВИСТИЧЕСКИЙ ТЕКСТОВЫЙ ПРОЦЕССОР _________________ 26

3.1. Задачи лингвистического процессора _________________________ 26
3.2. Нормализация текста (графематический анализ) ______________ 28

3.2.1. Выделение предложений, слов, символов, знаков препинания ___ 29 
3.2.2. Обработка пользовательской разметки  ______________________ 30 
3.2.3. Расшифровка нестандартных записей  _______________________ 30 

3.3. Использование словарей в синтезе речи _______________________ 32

 

3.4. Обработка незнакомых слов _________________________________ 33

 

3.5. Снятие омонимии (омографии) ______________________________ 34

 

3.6. Методы разрешения неоднозначности при анализе текста  ______ 35

 

3.6.1. Синтаксический и морфологический анализ предложения ______ 35 
3.6.2. Статистические методы ___________________________________ 35 

4. ПРОСОДИЧЕСКИЙ ПРОЦЕССОР  _______________________________ 36

4.1. Определение границ синтагм ________________________________ 36

4.1.1. Установка пауз по правилам _______________________________ 37 
4.1.2. Установка пауз на основе статистических моделей  ____________ 38 

4.2. Определение интонационного контура ________________________ 39

 

4.2.1. Генерация контура F0 методом ресинтеза ____________________ 40 
4.2.2. Формирование контура F0 для произвольного предложения _____ 42 
4.2.3. Генерация тонального контура в системах инженерного типа  ___ 43 
4.2.4. Генерация тонального контура на основе лингвистических моделей 
интонации ___________________________________________________ 45 

4.3. Примеры интонационных контуров __________________________ 47

 

5. ФОНЕТИЧЕСКИЙ ПРОЦЕССОР _________________________________ 48

5.1. Построение транскрипции  __________________________________ 48

5.2. Вычисление физических параметров _________________________ 50

6. АКУСТИЧЕСКИЙ ПРОЦЕССОР  _________________________________ 53

6.1. Оптимальный выбор звуковых элементов методом Unit Selection 53

6.1.1. Стоимость замены  _______________________________________ 55 
6.1.2. Стоимость связи _________________________________________ 57 
6.1.3. Поиск по алгоритму Витерби  ______________________________ 58 
6.1.4. Речевая база и качество синтеза для метода Unit Selection _______ 58 
6.1.5. Основные сложности и ограничения применения метода Unit 
Selection _____________________________________________________ 60 

6.2. Сглаживание энергетической огибающей _____________________ 60

 

6.3. Модификация звуковых элементов ___________________________ 61

 

6.3.1.Алгоритм TD-PSOLA _____________________________________ 61 
6.3.2. Алгоритм SPECINT (Spectrum Interpolation) __________________ 63 
6.3.3. Алгоритм LP-PSOLA _____________________________________ 68 
6.3.4. Экспериментальные сравнения _____________________________ 71 

6.4. Объединение элементов в единый звуковой поток  _____________ 74

 

6.5. Звуковые эффекты, используемые при синтезе речи ____________ 75

 

6.5.1. Параметрический эквалайзер  ______________________________ 76 
6.5.2. Ревербератор ____________________________________________ 78 

7. СИНТЕЗ, ОСНОВАННЫЙ НА МОДЕЛЯХ __________________________ 79
ЛИТЕРАТУРА ___________________________________________________ 85

 

ВВЕДЕНИЕ 

Автоматический  синтез  речи  -  это  технология,  позволяющая 

преобразовать входную текстовую информацию в звучащую речь. При этом 
одним из важнейших аспектов является качество синтезируемой речи. Именно 
от качества зависит пригодность использования технологии синтеза речи на 
современном  коммерческом  уровне.  Под 

системами  автоматического 

синтеза  речи 

(иначе  их  еще  называют 

синтезаторами  речи

)  в  настоящее 

время понимают системы, преобразующие орфографический текст и другую 
информацию  в  звучащую  речь.  Общепринятое  в  английской  литературе 
обозначение – TTS (

Text To Speech

) System – системы преобразования текста 

в речь. 

Технология автоматического синтеза речи может быть полезна в самых 

различных отраслях и направлениях, таких как: 

телекоммуникации,

мобильные устройства,

промышленные и бытовые электронные устройства,

автомобильная индустрия,

образовательные системы,

компьютеризированные системы,

Internet-сервисы,

системы ограничения доступа,

аэрокосмическая промышленность,

военно-промышленный комплекс.

Синтезаторы  речи  обладают  широкими  возможностями  применения. 

Например,  в  call-центрах  и  автоинформационных  системах.  Технология 
синтеза  речи  многого  достигла  в  своем  развитии.  Синтезированную  речь 
сегодня  часто  сложно  отличить  от  естественной  речи.  Позвонив  в 
информационную  службу,  мы  уже  слышим  не  роботизированную  речь,  а 
приятный естественный голос. Технология синтеза речи, интегрированная в 
автоинформационную  систему,  «охотно»  вступит  в  беседу  с  каждым 
дозвонившимся  и  поможет  в  получении  информации.  На  90%  запросов  к 
любым информационно-справочным системам способен отвечать компьютер. 
Автоинформационная  система  с  синтезом  речи  освобождает  операторов  от 
ответов  на  часто  повторяющиеся  вопросы  такого  плана  как  курс  доллара, 
точное  время,  прогноз  погоды  и  многое  другое.  Технология  синтеза  речи 
открывает  широкие  возможности  для  людей  с  физическими  недостатками. 
Разработаны  говорящие  машины  для  слепых  и  слабовидящих.  Для  немых 
предусмотрены портативные устройства синтеза речи, в которых сообщение 
набирается на клавиатуре, что позволяет общаться с другими людьми. 

На сегодняшний день благодаря электронным словарям и переводчикам 

на основе технологии синтеза речи возможно изучение иностранных языков с 
постановкой правильного произношения. Электронный словарь помещается в 
кармане  и  может  быть  использован  в  любом  месте,  а  не  только  за  рабочим 

 

столом,  как  это  обычно  бывает  с  традиционным  книжным  словарем.  Еще 
одним примером синтеза речи могут служить различные системы звукового 
оповещения:  телефонная  справочная  информация,  объявление  станций  в 
метро,  информация  об  отправлении  автобуса  или  поезда,  реклама  в 
универмаге. 

На  основе  технологии  синтеза  речи  созданы  «говорящие»  книги 

(аудиокниги).  Такие  книги  позволяют  по-новому  воспринять  литературное 
произведение  –  в  его  звуковом  оформлении.  Многие  люди  полагают,  что 
напечатанный  текст  не  передает  всей  полноты  ощущений.  В  то  время  как 
элементарная  разница  в  произношении  или,  например,  интонации  героев 
делает  произведение  более  живым.  Можно  с  уверенностью  сказать,  что 
системы синтеза речи в различных формах своего практического применения 
прочно вошли в нашу повседневную жизнь. 

 

1. 

СИСТЕМЫ СИНТЕЗА РЕЧИ: ИСТОРИЯ РАЗВИТИЯ, 
СОВРЕМЕННОЕ СОСТОЯНИЕ 

Синтез  речи,  то  есть  в  широком  смысле  искусственное  создание 

звучащей  речи,  подобной  человеческому  голосу,  –  задача,  которая  издавна 
интересовала  людей  (возможно,  как  часть  идеи  создания  искусственного 
человека). Существуют легенды о «говорящих головах», умевших отвечать на 
вопросы,  которые  были  созданы  Гербертом  Орильякским  (946  –  1003), 
Альбертом Великим (1198 – 1280) и Роджером Бэконом (1214 – 1294). Но и 
достоверная  история  создания  машин,  имитирующих  человеческую  речь, 
насчитывает  уже  более  двух  веков.  С  течением  времени  изменялись,  как  и 
сами  механизмы,  и  принципы  работы  синтезирующих  устройств,  так  и 
основные  области  интереса  и  задачи  учёных,  занимающихся  созданием  и 
развитием синтеза речи. 

1

.1. Первые механические синтезаторы 

Первые синтезаторы, появившиеся во второй половине XVIII века, были 

механическими,  они  могли  порож7дать  отдельные  звуки  или  небольшие 
фрагменты  слитной  человекоподобной  речи  подобно  музыкальным 
инструментам,  то  есть  требовали  участия  оператора-исполнителя.  Очень 
важным  является  то,  что  уже  в  них  посредством  различных  механических 
приспособлений  воспроизводились  основные  процессы,  происходящие  при 
производстве речи человеком. Первые механические машины являлись скорее 
музыкальными инструментами, чем сложными техническими системами. 

В 1779 году Петербургская Академия наук объявила ежегодную премию 

за объяснение разницы между пятью гласными звуками и за конструирование 
устройства,  их  порождающего.  Немецкий  учёный  Христиан  Готлиб 
Кратценштейн (1723 – 1795), работавший в то время в Петербурге, предложил 
лучшее  решение.  Он  создал  систему  резонаторов  (рис.  1.1),  при  помощи 
пульсирующего  воздушного  потока  порождавших  русские  гласные. 

 

Воздушный  поток  порождался  вибрирующими  язычками,  подобными 
голосовым связкам человека [2]. 

 

 

Рисунок 1.1. Система резонаторов Кратценштейна 

 

Ещё ранее и независимо от Кратценштейна над механической системой 

синтеза речи стал работать и представил результат своих трудов в 1791 году 
австрийский изобретатель Вольфганг фон Кемпелен (1734 – 1804). Его машина 
могла произносить различные звуки и их комбинации. В ней моделировалось 
продвижение струи воздуха через голосовой тракт человека: имелись меха для 
подачи воздуха на язычок, который возбуждал резонатор, управляемый рукой. 
Согласные, в том числе и носовые, получались с помощью четырёх каналов, 
зажимаемых пальцами  [2].  По  утверждению  самого  Кемпелена,  его  машина 
производила 19 хорошо различимых согласных звуков и короткие фразы на 
нескольких  языках.  Для  управления  «говорящей  машиной»  требовался 
хорошо обученный оператор, порождение речи можно было сравнить с игрой 
на органе. Усовершенствованный вариант машины Кемпелена (рис. 1.2) был 
создан в 1837 году английским физиком Чарльзом Уитстоном (1802 – 1875). 
Также  под  впечатлением  от  машины  Уитстона  американский  учёный  и 
изобретатель  Александр  Грэм  Бэлл  (1847  –  1922)  собрал  собственную 
аналогичную модель. 

В  течение  XIX  века  в  технологии  синтеза  речи  не  было  каких-либо 

революционных  изменений.  Известны  исследования  английского  учёного 
Роберта  Уиллиса  (1800  –  1875),  который  подобно  Кратценштейну 
экспериментировал  с  синтезом  гласных  звуков  и  установил  связь  между 
качеством  гласных  и  геометрической  формой  голосового  тракта.  В  своих 
работах  1828  года  «О  гласных  звуках»  и  «О  механизме  гортани»  Уиллис 
описал механизм извлечения гласных звуков по аналогии со звукоизвлечением 
органа. 

В 1840 году Джозеф Фабер (1800 – 1850) представил свою говорящую 

машину  под  названием  «Эйфония»,  которая  по  сообщениям  современников 
могла  производить  обычную  и  шепотную  речь,  а  также  исполнять  песни. 
Машина  Фабера  состояла  из  воздушного  меха,  который  приводился в 
движение  ножной  педалью.  Это  были  «как  бы»  легкие  человека.  Процесс 
производства  звука  был  следующим:  в  вытесняемый  из  меха  воздух 
направлялся в различные по объёму трубки, при помощи ряда клавиш. Каждая 

 

из этих трубок отвечала за разные положения голосовой щели и полости рта. 
То  есть  Фабер  хотел  просто  механически  воспроизвести  весь  голосовой 
аппарат  человека.  Правда,  ему  это  не  удалось  до  конца  осуществить. 
Голосовой тон в машине Фабера производился при помощи вибрации тонкой 
пластинки из слоновой кости на каучуковой подкладке. Звук получался очень 
резким и крикливым. Проще говоря, очень неприятным для человеческого уха. 
В  источниках,  описывающих  работу  машины  Фабера  указано,  что  звук  «p» 
производится  вибрацией  не  «языка»,  а  твердой  пластинки,  помещенной  за 
гортанью. А вот трубка, изображающая нос, находилась не сверху надставной 
трубы,  изображающей  рот,  а  ниже  её  и.  Механизм,  в  целом,  был очень 
тяжелым,  и  требовал  серьезных  усилий  со  стороны  исполнителя,  который 
пытался извлечь звуки речи. 

 

Рис. 1.2. Говорящая машина Кемпелена, построенная Уитстоном

 

 
В XX веке, несмотря на развитие электрических методов синтеза речи, 

разработка механических синтезаторов речи проводилась до 60-х годов. Это 
было связано, с одной стороны, с малой доступностью сложных электрических 
компонентов,  а  с  другой  –  с  необходимостью  имитации  и  измерения 
нелинейных эффектов в голосе, которые с трудом поддаются расчётам и не 
могут быть легко смоделированы с помощью линейных устройств [2]. Среди 
наиболее известных устройств следует упомянуть механический синтезатор Р. 
Риша,  продемонстрированный  им  в  1937  году  (рис.  1.3).  По  форме  он 
практически повторял голосовой тракт человека, был выполнен из резины и 
металла и управлялся клавишами, подобными клавишам трубы. 

Таким  образом,  общим  методом  создания  механических  синтезаторов 

стала имитация или прямое моделирование голосового тракта человека. 

 

 

Рис. 1.3. Механическое говорящее устройство Риша 

 
Основными  рабочими  компонентами  таких  моделей  были:  устройство 

для  подачи  воздуха  (аналог  лёгких),  вибрирующая  часть  (аналог  гортани) и 
система резонаторов, в большей или меньшей степени точно воссоздававших 
форму  голосового  тракта  человека.  Механические  синтезаторы  стали 
прототипом современного артикуляционного синтеза. Всё более новые и всё 
более сложные механические синтезаторы регулярно появлялись примерно до 
середины XX века. 

1.2. 

Первые электрические синтезаторы 

В  XIX  веке  появление  резонаторной  теории  Гельмгольца  дало  новый 

толчок  в  развитии  речевых  исследований.  Речевой  тракт  человека 
рассматривался как последовательность резонаторов. Было установлено, что 
гласные  звуки  различаются  резонансными  частотами,  названными 
впоследствии 

формантами

.  Вокальный  тракт  может  быть  рассмотрен  как 

простая  акустическая  труба  с  открытым  концом  или  резонатор.  Форманты 
образуются  при  прохождении  звуковой  волны  от  звукового  источника 
(голосовых складок) к губам. Звук частично отражается от губ говорящего и 
идет  к  слушателю,  а  частично  отражается  от  губ  и  идет  в  обратном 
направлении к голосовым складкам. 

Начались попытки построить синтезаторы речи – электрические аналоги 

речепроизводящей  системы.  Самый  первый  электрический  синтезатор  был 
создан  Дж. Стюартом  в  1922  году.  Его  схема  (рис.  1.4)  включала  в  себя 
электрический  зуммер  для  моделирования  голосовых  связок  и  пару 
индуктивно-ёмкостных  резонаторов  для  моделирования  резонансов  горла  и 

10 

 

ротовой  полости.  Таким  образом,  генерировались  первые  две  форманты,  то 
есть устройство могло синтезировать только гласные звуки. 

 

Рис. 1.4. Электрическая модель голосового тракта Стюарта 

Аналогичный  синтезатор,  состоящий  из  четырёх  подключенных 

параллельно  резонаторов,  возбуждаемых  прерывателем  тока,  был  создан 
немецким инженером Карлом Вилли Вагнером (1883 – 1953) в 1936 году [2]. 

Следующий  важный  шаг  в  формировании  технологии  синтеза  речи 

связан  с  развитием  радиотехники,  построением  вокодеров  (систем 
кодирования  и  декодирования  речи,  в  которых  используются  различные 
методы сжатия полосы частот для передачи сигналов, «voice coder») и ЭВМ. 
Первым  электрическим  синтезатором,  способным  генерировать  фрагменты 
связной речи, стал «водер» (Voder – Voice Operating Demonstrator), созданный 
американским  инженером  Гомером  Дадли  (1896  –  1987),  Р.  Ришем  и  С. 
Уоткинсом.  Водер  был  основан  на  вокодере  (н

азвание  произошло  от  двух 

слов voice — голос, и coder — кодировщик

), созданном в Bell  Laboratories  в 

середине  30-х  годов.  От  вокодера  была  взята  синтезирующая  часть, 
управлявшаяся  вручную  посредством  тринадцати  клавиш,  ножной  педали и 
переключателя источника шума на браслете (рис. 1. 5) [2]. 

Водер  управлялся  от  ручной  клавиатуры  и  синтезировал  сигналы  с 

заданным  спектром.  Десять  параллельно  соединенных  полосовых  фильтров 
составляли  блок  управления  резонансами.  Переключение  источника 
возбуждения  -  шумового  или  импульсного  генератора  -  осуществлялось 
браслетом на запястье оператора, а управление частотой импульсов - ножной 
педалью. На выходе фильтров стояли потенциометры, управлявшиеся десятью 
пальцами и изменявшие напряжение сигнала каждого фильтра. Для имитации 
взрывных  согласных  использовались  еще  три  дополнительные  клавиши. 
Обучение операторов "игре" на водере требовало значительного времени, но 
зато  в  итоге  получалась  довольно  качественная  речь  с  высоким  уровнем 
разборчивости. Усовершенствованный вариант вокодера Дадли, VODER, был 
представлен на Нью-Йоркской Всемирной выставке 1939 года. 

11 

 

 

Рис. 1.5. Схема вокодера Дадли

 

В 1938 году советским ученым Е.А.Мурзиным был создан синтезатор 

звуков  АНС.  Евгений  Мурзин,  назвал  свое  изобретение  в  честь  Александра 
Николаевича Скрябина. 

В  этом  устройстве  речь  генерировалась  с  помощью  рядов  Фурье  как 

сумма  гармоник —  элементарных  спектральных  составляющих,  то  есть 
чистых  тонов.  Банк  тонов  был  записан  на  покрытый  фотоэмульсией 
стеклянный  диск,  очень  похожий  на  современный  компакт-диск.  Он  был 
покрыт  фотоэмульсией,  и  с  помощью  специального  станка  на  него 
концентрическими  кольцами  были  записаны  144  фотооптические  звуковые 
дорожки "чистых тонов". Как происходил синтез звука показано на рис. 1.6. 

Важным этапом в развитии методов экспериментальных фонетических 

исследований и синтеза речи стала разработка звукового спектрографа в 1946 
году.  Появилась  идея  использования  спектрограмм  для  управления 
синтезатором речи. 

Для автоматического озвучивания речевых спектрограмм было создано 

несколько  устройств.  В  устройстве  Л.  Шотта  1948  года  использовался 
линейный источник света, расположенный вдоль оси частот спектрограммы и 
просвечивающий участки изображения с различной степенью прозрачности, а 
фотоэлементы,  расположенные  в  ряд  вплотную  друг  к  другу  по  другую 
сторону  спектрограммы,  являлись  источником  управляющих  сигналов  для 

12 

 

набора тех же полосовых фильтров, что и в водере Дадли. Дополнительные 
дорожки  на  спектрограмме  управляли переключением  тона  и  шума  и  несли 
информацию о частоте основного тона (ЧОТ). Подобный метод использовался 
Дж. Борстом и Ф. Купером в устройстве, названным ими «водек» (1957 год) 
[2]. 

 

Рис. 1.6. Синтезатор Мурзина 

Наиболее  известный  «проигрыватель»  спектрограмм,  синтезатор 

Pattern Playback (рис. 1.7), был представлен американскими исследователями 
Ф.  Купером,  А.  Либерманом  и  Дж.  Борстом  в  1951  году.  Он  состоял  из 
оптической  системы  для  динамической  модуляции  амплитуд  гармоник 
основного  тона  в  120  Гц  в  зависимости  от  изображений  на  движущейся 
прозрачной ленте. 

Рис. 1.7. Синтезатор Pattern Playback

 

При помощи этого синтезатора, позволявшего производить монотонную 

разборчивую  речь,  проводились  многочисленные  эксперименты  по  оценке 
значимости  для  восприятия  речи  различных  акустических  характеристик, 
путём упрощения и стилизации подаваемых на синтез фонограмм. 

В первых электрических синтезаторах уже напрямую не моделируется 

голосовой  тракт  человека.  Вместо  этого  основным  методом  создания 
синтезированной  речи  является  моделирование  (или  прямое  считывание  со 

13 

 

спектрограммы)  акустических  характеристик  речевого  сигнала.  Основными 
рабочими компонентами таких синтезаторов были устройства, генерирующие 
шум  и  периодический  сигнал,  и  набор  фильтров  или  резонаторов, 
усиливающих 

заранее 

определённые 

частотные 

составляющие. 

Электрические синтезаторы стали прототипом современного компьютерного 
параметрического синтеза. 

Следующей  важной  вехой  в  истории  синтеза  речи  стало  развитие 

акустической  теории  речеобразования  (1960),  создавшей  необходимую 
теоретическую  базу  для  создания  основанных  на  ней  формантных  и 
артикуляционных  синтезаторов,  а  также  синтезаторов,  использующих 
линейное  предсказание.  Эти  три  метода  называют  также  технологиями 
синтеза первого поколения [3].

 

1.3. 

ХХ век: синтезаторы первого поколения 

Синтезаторы  первого  поколения  можно  на  основании  используемых 

методов разделить на две большие группы: акустические и артикуляционные. 
К направлению акустического синтеза относится формантный синтез и синтез 
с  использованием  линейного  предсказания.  При  создании  акустических 
синтезаторов  не  ставится  задачи  непосредственного  отражения  в  синтезе 
процессов, связывающих артикуляцию с акустикой речевого сигнала, а вместо 
этого они выявляют и воспроизводят в синтезируемом сигнале существенные 
для  восприятия  акустические  характеристики  естественной  речи.  В  этом 
смысле  акустический  синтез  является  продолжением  того  направления, 
которое было начато созданием вокодеров и электрических параметрических 
синтезаторов разного типа. 

1.3.1. 

Артикуляционный синтез 

Артикуляционный  (или  артикуляторный)  синтез  в  некоторой  мере 

продолжил направление, заданное первыми механическими синтезаторами. В 
нём делается попытка синтезировать речевой сигнал на основе моделирования 
процесса речеобразования с учетом сведений об артикуляции, используемых 
для количественной оценки формы речевого тракта, его резонансных свойств 
и  характеристик  звуковых  источников.  Затем  на  основе  расчетных  данных 
генерируется  речевой  сигнал.  В  артикуляционной  модели  трубка, 
соответствующая  голосовому  тракту,  обычно  разделяется  на  множество 
небольших  секций,  и  таким  образом  может  быть  представлена  в  качестве 
неоднородной электрической линии передачи [2]. 

Первые  электронные  артикуляционные  модели  были  статическими  и 

требовали 

ручной 

настройки. 

Первый 

синтезатор 

американского 

исследователя Х. Данна 1950 года состоял из 25 одинаковых звеньев, между 
которыми  для  учёта  влияния  положения  языка  можно  было  ввести 
переменную  индуктивность,  а  индуктивность  на  конце  линии  отражала 
влияние  губ.  Для  произнесения  вокализованных  звуков  синтезатор 
возбуждался  пилообразным  напряжением  регулируемой  частоты,  а  шумные 

14 

 

звуки  получались  подключением  к  соответствующей  точке  линии  белого 
шума [2]. 

Первый  артикуляционный  синтезатор  с  динамическим  контролем 

(рис. 1.8)  DAVO  (Dynamic  Analog of the  VOcal  tract)  был разработан  в  1958 
году  в  Массачусетском  технологическом  институте  Д.  Розеном.  Он 
управлялся записанными на ленту контролирующими сигналами, созданными 
вручную. 

С течением времени артикуляционные синтезаторы развивались, в них 

вводилось  дополнительное  моделирование  ослабления  сигнала  в  голосовом 
тракте, взаимодействия источника и фильтра, распространения сигнала от губ 
и,  конечно,  совершенствовалось  моделирование  голосового  источника 
сигнала. Кроме этого, многие подходы включают моделирование движений и 
параметров  мышц  и  управления  моторикой.  Однако  из-за  сложностей 
подобного рода моделирования в большинстве современных систем синтеза 
речи,  позволяющих  получать  речь  высокого  качества,  используются  более 
«простые» подходы, а артикуляционный синтез чаще применяется в научных 
исследованиях  в  области  артикуляционной  фонетики  и  физиологии  речи. 
Кроме  этого,  артикуляционный  синтез  непосредственно  связан  с  областью 
аудиовизуального  синтеза  (или  «говорящей  головы»),  задачей  которого 
является построение визуальной модели головы и лица в процессе говорения 
[3]. 

 

Рис.1.8 . Аналог голосового тракта с линией передачи, управляемый 

непрерывно

 

1.3.2. 

Формантный синтез 

Первым  формантным  синтезатором  стал  PAT  (Parametric  Artificial 

Talker) английского исследователя Уолтера Лоуренса, представленный в 1953 
году. Этот синтезатор состоял из трёх электронных формантных резонаторов, 
соединённых  параллельно,  на  вход  которым  подавался  шум  или 
гармонический сигнал. Он управлялся шестью временными функциями (три 
форманты, частота основного тона, амплитуда шума и амплитуда голосового 

15 

 

источника), которые считывались с нарисованных на движущейся стеклянной 
дорожке  шаблонов.  Этот  синтезатор  был  первым  из  параллельных 
формантных синтезаторов. Их главным преимуществом была относительная 
простота 

управления. 

Вторым 

типом 

формантных 

синтезаторов, 

позволяющим более точно моделировать передаточную функцию голосового 
тракта,  но  имеющих  зачастую  более  сложную  структуру,  стали  каскадные 
синтезаторы,  в  которых  формантные  резонаторы  были  соединены 
последовательно (рис. 1.9). 

В  том  же  1953  году  известный  шведский  исследователь  речи,  автор 

классической  акустической  модели  речеобразования  «источник-фильтр» 
Гуннар  Фант  продемонстрировал  свой  каскадный  формантный  синтезатор 
OVE I  (Orator  Verbis  Electris).  В  нём  частота  двух  нижних  резонаторов 
контролировались механической рукой, а амплитуда и частота основного тона 
определялись ручными потенциометрами. 

 

Рис.1.9. Каскадный и параллельный синтезаторы

 

В 

дальнейшем 

оба 

типа 

синтезаторов 

усложнялись 

и 

совершенствовались,  позволяя  каждой  новой  версии  звучать  всё  ближе  к 
естественной  человеческой  речи.  В  1973  году  английскому  исследователю 
Джону  Холмсу  удалось  вручную  настроить  на  своём  синтезаторе 
произнесение предложения «I enjoy the simple life» так хорошо, что обычный 
слушатель  не  мог  отличить  его  от  произнесения  того  же  текста  живым 
человеком. Однако оставалась проблема с автоматическим контролем работы 
синтезатора,  который  не  мог  пока  приблизиться  к  ручной  настройке 
произнесения

 

С  развитием  компьютерной  техники  и  появлением  вычислительных 

машин  в  середине  50-х  годов  электрические  аналоговые  синтезаторы  стали 
постепенно  замещаться  компьютерными  программами  или  специально 

16 

 

сконструированной  цифровой  аппаратурой,  позволявшими  работать  с 
цифровым  представлением  речевого  сигнала.  В  1972  году  американский 
исследователь  Д.  Клатт  предложил  вариант  гибридного  формантного 
синтезатора,  в  котором  сонорные  и  шумные  звуки  синтезировались 
каскадными  и  параллельными  формантными  резонаторами  соответственно. 
Публикация  исходного  кода  программы  на  языке  Фортран  в  1980  году 
позволила  учёным  в  различных  лабораториях  оценить  работу  этого 
синтезатора, а также помогла в проведении перцептивных экспериментов. 

Первая модель формантного синтезатора русской речи «Фонемофон-1» 

(рис.  1.10)  была  разработана  в  Минске  в  начале  70-х  годов,  и  успех  в  её 
создании  был  связан,  прежде  всего,  с  разработкой  принципов  формантного 
синтеза

 

речевых сигналов. В последующих версиях удалось добиться синтеза 

русской речи по произвольному тексту весьма высокого качества [4]. В это же 
самое  время  начались  исследования  в  области  синтеза  речи  на  кафедре 
фонетики  филологического  факультета  ЛГУ.  В  конце  80-х  годов  на  основе 
накопленного  опыта  стало  возможным  развитие  проекта  системы 
автоматического синтеза речи по произвольному русскому тексту. В 1989 году 
был изготовлен первый образец компилятивного синтеза.

 

 

Рис. 1.10. Внешний вид синтезатора «Фонемофон-1»

 

1.3.3. 

Синтезаторы, использующие линейное предсказание

  

Метод линейного предсказания позволяет напрямую использовать при 

синтезе  искусственной  речи  параметры  передаточной  функции  голосового 
тракта и является своеобразной альтернативой формантному синтезу. Первые 
эксперименты с кодированием речи при помощи коэффициентов линейного 
предсказания (КЛП) были проведены в середине 60-х годов. Эта технология 

17 

 

впервые  была  использована  в  недорогих  устройствах  типа  TI  Speak’n’Spell 
(1980).  Для  синтеза  речевого  сигнала  в  КЛП-синтезаторе  используются 
следующие  изменяющиеся  во  времени  параметры:  период  основного  тона, 
средняя громкость звука, признак тон-шум и определённое заранее количество 
коэффициентов линейного предсказания. При этом качество синтезированной 
речи  зависит от  числа  коэффициентов,  точности  их  вычисления,  а  также от 
того, насколько хорошо моделируются источники возбуждения.  

Обычно для работы КЛП-синтезатора из оцифрованной речи человека 

вычисляются  необходимые  параметры,  а  далее  все  необходимые  единицы 
синтеза  (слова  или  более  короткие  единицы)  записываются  в 
параметризованном  виде  в  память  и  затем  при  синтезе  извлекаются  и 
соединяются, или конкатенируются, в определённом порядке. Таким образом, 
модель  линейного  предсказания  косвенно  поспособствовала  развитию 
технологии  конкатенативного  синтеза.  Синтезаторы  первого  поколения 
обычно требовали детального описания того, что должно быть произнесено, и 
не  включали  какого-либо  автоматического  способа  получения  подобного 
описания для произвольного сообщения или текста. 

1.4. 

ХХ век: синтезаторы второго поколения 

В  середине  60-х  годов,  в  связи  с  продолжающимся  развитием 

компьютерной  техники  и  возросшими  потребностями  общества,  перед 
разработчиками  автоматического  синтеза  речи  была  поставлена  более 
широкая  задача  озвучивания  любого  сообщения,  вводимого  в  компьютер  в 
текстовом  виде  и  неизвестного  заранее  системе  синтеза.  Это  привело  к 
развитию  синтезаторов  типа  TTS.  В  идеале  такие  устройства  должны 
имитировать деятельность человека, который читает письменное сообщение 
или текст любой степени сложности. Поэтому в синтезаторах такого типа (то 
есть  синтезаторах  речи  в  современном  понимании  этого  термина)  появился 
блок  лингвистической  обработки,  независимый  от  акустического  блока  и 
метода  генерации  речевого  сигнала,  тогда  как  самые  ранние  синтезаторы  и 
синтезаторы  первого  поколения  были  ориентированы  в  основном  или 
полностью на модельную разработку акустического блока, то есть на задачу 
генерации речевого сигнала.  

Первая полноценная система TTS для английского языка была создана в 

1968  году  в  Японии  Норико  Умеда  и его  коллегами.  Она  была  основана на 
артикуляционной модели акустического блока. Анализ текста и расстановка 
пауз  производились  при  помощи  сложных  правил.  По  свидетельству 
специалистов,  речь,  производимая  этой  системой,  была  разборчивой,  но 
довольно  монотонной.  В  дальнейшем  алгоритмы  лингвистической 
предобработки  текста  усложнялись  благодаря  увеличению  скорости 
компьютерного  анализа  данных  и  объёма  памяти  для  хранения 
вспомогательной  лингвистической  информации  (различных  словарей, 
речевых  баз,  моделей  и  т.  п.).  Это  позволяло  более  точно  представлять 
необходимые для акустического синтеза детальные фонетические описания: 

18 

 

фонетическую  транскрипцию  и  просодические  характеристики  сегментных 
единиц,  получаемые  на  основе  интонационных  моделей  (длительность, 
частоту основного тона и громкость).  

Следует  подчеркнуть,  что  эти  фонетические  описания  должны  быть 

преобразованы  в  процессе  синтеза  во  входные  данные  (акустические 
характеристики), необходимые блоку генерации речевого сигнала (например, 
частоты формант), что может быть сделано двумя способами: либо с помощью 
особых  правил,  либо  посредством  измерения  (или  «копирования»)  этих 
характеристик  для  отдельных  звуков  или  целых  фраз  естественной 
человеческой речи. Копирование характеристик является наиболее простым и 
эффективным  методом  получения  качественной  (то  есть  разборчивой  и 
естественной)  синтезированной  речи.  Так  называемый  ресинтез  (подача  на 
вход  синтезатора  акустических  характеристик  естественной  речи),  является 
также  надежным  способом  понять,  насколько  хорошо  работает  его 
акустический компонент. 

1.5. 

ХХ век: синтезаторы третьего поколения 

К  третьему  поколению  технологий  автоматического  синтеза  речи 

обычно  относят  синтез  на  основе  скрытых  Марковских  моделей  (HMM

  – 

hidden Markov models)  и  селективный  синтез  речи  [2].  В  англоязычных 
источниках  метод  называют 

unit selection.

  Их  общей  чертой  является 

использование для автоматического синтеза речи больших объёмов речевых 
данных, а также высокая естественность синтезированной речи. 

1.5.1. 

Селективный синтез речи 

Метод Unit Selection является в настоящее время основной технологией 

автоматического  синтеза  речи,  так  как  он  позволяет  получать 
синтезированную  речь,  которая  по  своим  характеристикам  наиболее 
приближена к естественной [2]. 

Метод является разновидностью конкатенативного синтеза речи, то есть 

в  процессе  синтеза  речевого  сигнала  используются  заранее  сделанные 
звукозаписи естественной речи. В отличие от более ранних аллофонных

1

 или 

дифонных

2

  синтезаторов  речи,  порождающих  итоговый  речевой  сигнал  из 

отдельных  и  специально  подготовленных  звуковых  единиц,  выделенных  из 
небольшого и тщательно подобранного набора слов, при селективном синтезе 
для  каждой  базовой  единицы  синтеза  производится  выбор  наиболее 
подходящего  кандидата  из  множества  вариантов,  взятых  из  озвученных 
предложений  естественного  языка.  Для  этого  записываются  специальные 
звуковые  базы,  размер  которых  может  составлять  до  нескольких  десятков 
часов  звучащей  речи.  В  процессе  акустического  синтеза  алгоритм  строит 

                                                 

1

  Аллофон  —  реализация  фонемы,  один  из  ее  вариантов,  обусловленный 

конкретным  фонетическим  окружением.  В  отличие  от  фонемы,  является  не 
абстрактным понятием, а конкретным речевым звуком. 

2

 Дифон — сегмент речи между серединами соседних аллофонов.

 

19 

 

оптимальную последовательность звуковых единиц, учитывая одновременно 
и то, насколько кандидат подходит под описание необходимых характеристик 
звука (стоимость замены), и то, насколько хорошо выбранные элементы будут 
конкатенироваться  с  соседними  (стоимость  связи).  При  этом  с  учетом 
указанных стоимостей из базы в качестве оптимальных могут быть выбраны 
не отдельные звуки, а их цепочки или даже целые предложения. Такой подход 
позволяет  минимизировать  модификации  речевого  сигнала,  что  повышает 
естественность синтезируемой речи.  

Первыми системами селективного синтеза стали n-Talk (1992) и CHATR 

(1994), а в 1996 году известные специалисты по синтезу речи А. Хант и А. Блэк 
предложили  алгоритм  выбора  оптимальной  последовательности  единиц  для 
конкатенации, который стал классическим [5].

 

1.5.2. 

Статистический параметрический синтез 

Статистический 

параметрический 

синтез 

является 

методом, 

основанным не на правилах, а на имеющихся акустических данных. При этом 
подходе  делается  попытка  машинного  обучения  системы  на  имеющихся 
речевых данных с целью получения модели соответствия характеристик речи, 
поступающих на вход акустического блока, физическим параметрам звуковых 
единиц. Получаемая модель даёт два преимущества: уменьшение памяти для 
хранения  модели  вместо  самой  речевой  базы  и  возможность  её 
параметрической модификации, например, быстрого изменения тембра голоса 
[2]. 

Наиболее  распространённой  техникой  в  данном  направлении  синтеза 

является метод, основанный на использовании скрытых Марковских моделей. 
Скрытые  Марковские  модели  звуковых  единиц  применялись  в  системах 
распознавания  речи  с  конца  70-х  годов.  Работу  над  автоматическими 
системами синтеза речи, основанными на HMM, начали в 1995 году японские 
учёные  К. Токуда  с  коллегами  [6].  Возможность  использования 
статистического  подхода  в  применении  к  синтезу  речи  обусловлена 
возросшим  быстродействием  вычислительных  машин  и  объёмов  носителей 
информации для хранения больших речевых баз, необходимых для обучения 
акустических моделей. 

1.6. 

Перспективные направления синтеза 

Основными  направлениями  современных  исследований  в  области 

автоматического  синтеза  речи  являются  аудиовизуальный  синтез,  синтез 
экспрессивной и эмоциональной речи, а также объединение двух подходов к 
синтезу речи третьего поколения: селективного синтеза и синтеза на основе 
скрытых Марковских моделей [2]. 

 

20 

2. ОБЗОР ТЕХНОЛОГИЙ TTS

2.1. 

Типы синтезаторов 

Речевые  синтезаторы  принято  делить  на  два  типа:  с  ограниченной  и 

неограниченной словарной базой. В синтезаторах с ограниченным словарем 
речь хранится в виде отдельных слов или предложений, которые выводятся в 
определенной  последовательности  в  процессе  синтеза  речевого  сообщения. 
Речевая база в системах такого типа произносится диктором заранее, а затем 
преобразуется  в  цифровую  форму  с  использованием  различных  методов 
кодирования,  для  уменьшения  необходимого  объема  для  ее  хранения  на 
носителе.  В  синтезаторах  с  неограниченным  словарем  элементами  речи 
являются  фонемы  или  слоги,  поэтому  в  них  применяется  метод  синтеза  по 
фонетическим  правилам,  а  не  простая  компоновка.  Данный  метод  весьма 
перспективен,  т.к.  обеспечивает  работу  с  любым  необходимым  словарем, 
однако  качество  речи  значительно  ниже,  чем  при  использовании  метода 
компоновки. 

На  сегодняшний  день  в  сфере  синтеза  речи  можно  выделить  три 

основные группы методов: 

параметрический синтез;

компилятивный синтез;

синтез речи по фонетическим правилам.

Каждый  из  подходов  характеризуется  наличием  ряда  достоинств  и 

недостатков. 

2.1.1. 

Параметрический синтез 

Параметрический  синтез  речи  является  итоговой  операцией  в 

вокодерных системах, где речевой сигнал представлен набором непрерывно 
изменяющихся  во  времени  параметров.  Данный  метод  речевого  синтеза 
целесообразно  использовать  в  случаях,  когда  набор  текстовых  сообщений 
ограничен  и  редко  подвержен  изменению.  К  достоинствам  данного  метода 
относится возможность записать речь для любого языка и любого диктора. В 
зависимости  от  степени  сжатия  информации  в  параметрическом 
представлении качество синтезируемой речи может достигать очень высокого 
уровня.  Недостатком  такого  подхода  является  невозможность  применять 
параметрический синтез для заранее не заданных сообщений. 

2.1.2. 

Компилятивный синтез 

Компилятивный  синтез  сводится  к  составлению  сообщения  из 

предварительно записанного словаря исходных элементов синтеза. Очевидно, 
что  содержание  синтезируемых  сообщений  фиксируется  объёмом  словаря. 
Как  правило,  число  единиц  словаря  не  превышает  нескольких  сотен  слов. 

21 

 

Основная проблема в компилятивном синтезе — объёмы памяти для хранения 
словарной  базы.  Для  решения  этой  проблемы  используются  разнообразные 
методы сжатия/кодирования речевого сигнала. Компилятивный синтез имеет 
широкое практическое применение. За рубежом разнообразные устройства (от 
военных самолётов до бытовых устройств) оснащаются системами речевого 
ответа.  Примером  компилятивного  синтеза  речи  являются  объявления  в 
транспорте:  фразы  «Осторожно,  двери  закрываются»,  «Следующая 
остановка:», «Остановка…» и названия остановок записаны диктором заранее 
и  лишь  соединяются  вместе  для  оповещения  по  команде  водителя  или 
кондуктора.

 

2.1.3. 

Синтез речи по фонетическим правилам 

В  зависимости  от  размера  исходных  элементов  здесь  различают 

следующие виды синтеза: 

 

микросегментный; 

 

аллофонный; 

 

дифонный; 

 

полуслоговый; 

 

слоговый; 

 

синтез из различных единиц произвольного размера. 

Часто в качестве таких элементов используются полуслоги — сегменты, 

содержащие  половину  согласного  и  половину  примыкающего  к  нему 
гласного. При этом появляется возможность синтезировать речь по заранее не 
заданному  тексту,  но  возникают  проблемы  управления  интонационными 
характеристиками. Качество такого синтеза не совсем соответствует качеству 
естественной  речи,  поскольку  на  границах  «сшивки»  дифонов  часто 
возникают искажения. 

Однако и компиляция речи из заранее записанных словоформ также не 

решает  проблемы  высококачественного  синтеза  произвольных  сообщений, 
поскольку  акустические  и  просодические  (длительность  и  интонация) 
характеристики слов изменяются в зависимости от типа фразы и места слова 
во  фразе.  Это  положение  не  меняется  даже  при  использовании  больших 
объемов памяти для хранения словоформ. 

2.2. 

Оценка качества синтеза речи 

При  разработке  систем  автоматического  синтеза  речи  очень  важным 

является  вопрос  оценки  качества  синтеза  речи.  В  процессе  оценки  качества 
учитываются следующие основные характеристики: 

 

разборчивость речи; 

 

естественность (натуральность) речи; 

 

мультимодальность речи; 

22 

 

 

многоязычие. 

Рассмотрим указанные характеристики более подробно.  

Основным  критерием  оценки  качества  синтеза  речи  является 

разборчивость 

синтезированной  речи.  Очевидно,  что  чем  выше 

разборчивость  речи,  тем  более  высокого  класса  синтезатор.  Существуют 
различные  способы  (типы)  оценки  разборчивости,  основными  из  которых 
являются следующие: 

 

звуковая (не менее 75 %); 

 

слоговая (не менее 85 %); 

 

словесная (не менее 99 %); 

 

фразовая (98 – 99 %); 

 

смысловая. 

Обычно разборчивость измеряется (оценивается)  следующим образом. 

Речевая система синтезирует различные неожиданные для слушателя фразы. 
Указанные фразы фиксирует группа слушателей, каждый из которых пытается 
разобрать  (распознать),  что  сказала  машина.  Например,  предоставляется 
возможность прослушать 100 фраз, и слушатели поняли 98 – 99 % – это очень 
хорошая фразовая разборчивость. 

При  оценке 

словесной  разборчивости 

слушателям  предлагаются 

отдельные  слова,  самые  разные,  но  осмысленные,  никак  между  собой  не 
связанные,  из  разных  областей.  Слушатели  записывают  слова,  которые  они 
поняли  (расслышали).  Затем  подсчитывается  количество  понятых  слов  и 
рассчитывается  процент  относительно  общего  количества  предложенных 
слов. При словесной разборчивости хорошим считается результат не менее 99 
%. 

В 

случае 

оценки 

слоговой 

разборчивости 

произносятся 

бессмысленные слоги (например, «псу», «ваз», «дус», «гры» и т.д.). При этом 
используются  специальные  таблицы  частотной  встречаемости  слогов,  с 
учетом  которых  формируются  тестовые  последовательности,  которые 
подаются на вход речевой системы. Слушателям опять-таки следует записать 
все  понятые  ими  слоги.  Затем  подсчитывается,  сколько  слогов  услышано 
правильно:  если  примерно  85  %  и  выше,  то  разборчивость  считается 
достаточной. 

Звуковая  разборчивость 

оценивается  по  тем  же  бессмысленным 

слогам, но считается не число неправильных восприятий (если хотя бы один 
звук  в  слоге  был  воспринят  неправильно,  то  слог  уже  неправильный),  а 
считается  число  звуков,  т.е.  фонем,  воспринятых  неправильно.  Поскольку 
слоги  состоят  из  различных  звуков,  то  считается,  что  75  %  правильно 
воспринятых звуков – это уже неплохо. 

23 

 

При  оценке  разборчивости  используются  также  градации,  т.е.  более 

градуированные оценки – какая разборчивость считается отличной, хорошей, 
удовлетворительной, неудовлетворительной. 

Следующей  характеристикой,  используемой  для  оценки  качества 

синтезатора  речи,  является 

естественность 

(натуральность) 

речи

.  Это 

субъективная  характеристика,  которая  оценивается  слушателями  на 
основании их личного восприятия речи. Натуральность синтезированной речи 
зависит  от  многих  факторов,  например,  могут  быть  натуральные  звуки,  но 
ритмическая  сторона  речи  может  быть  сильно  испорчена.  Иначе  говоря, 
слушатель  может  слышать  понятную  и  разборчивую  речь,  произносимую 
вполне  естественным  голосом,  но  интонация  при  этом  какая-то 
неестественная, «роботная». Это может также проявляться в том, что машина 
путает или “съедает” ударения. 

Натуральность речи можно оценить, но нет объективных критериев – это 

только субъективное впечатление слушателя. Ведь даже разные люди имеют 
разное 

произношение, 

которое 

иногда 

может 

даже 

показаться 

неестественным. При реализации речевых синтезаторов интонация и ритмика 
речи  определяются  исходя  из  анализа  входного  предложения.  Расстановка 
ударений  в  словах  осуществляется  в  соответствии  со  словарём  и  с  учётом 
синтаксических правил. 

Под 

мультимодальностью речи 

понимают отражение эмоционального 

состояния говорящего, индивидуальность его голоса, стиль речи, акцент и т.п. 
В  системах  автоматического  синтеза  речи  эта  характеристика  выражается  в 
возможности  синтеза  различных  типов  голосов  и  их  индивидуальных 
особенностей.  Эта  возможность  относится  к  экстралингвистическим 
способностям  системы,  так  как  не  связана  с  языковыми  и  собственно 
речевыми  особенностями  реализации.  К  мультимодальности  речи,  в 
частности,  относят  поддержку  мужских  и  женских  голосов,  различные 
голосовые модуляции (бас, баритон). Сюда же относится возможность синтеза 
некоторых  эмоциональных  компонент,  содержащихся  в  речи,  таких,  как 
волнение,  гнев,  ласка  и  т.п.  Не  всегда  хорошо,  когда  синтезатор  «говорит» 
безразлично  и  монотонно;  во  многих  случаях  полезно,  когда  он  «говорит», 
моделируя эмоции человека. 

В  отличие  от  мультимодальности, 

многоязычие 

относится  к 

лингвистическим способностям и подразумевает возможность синтеза речи на 
нескольких естественных языках. Например, на русском, английском и т.д. 

2.3. 

Структура TTS 

Система синтеза речи обычно состоит из четырех основных частей, 

будем называть их процессорами. 

Лингвистический  текстовый  процессор

.  Он  предназначен  для 

решения следующих задач. 

24 

 

 

Выделение предложений

 в тексте и разбиение их на 

отдельные слова

разметка  текста  на  буквы,  специальные  символы,  цифры  и  знаки 
пунктуации.  Данный  шаг  необходим  для  успешности  дальнейшей 
обработки текста. 

 

Учёт 

разметки 

текста

проставленной 

пользователем 

(пользовательские 

теги, 

пользовательский 

знак 

ударения). 

Пользовательская разметка имеет приоритет над обработкой текста по 
умолчанию. 

 

Нормализация  текста

.  Текст,  подаваемый  на  синтез,  часто  содержит 

большое количество обозначений, которые не могут быть прочитаны (т. 
е. транскрибированы) в исходном виде. Требуется их расшифровка. Эта 
процедура называется нормализацией текста. 

 

Определение места ударения

 и морфо-грамматических характеристик 

слов в предложении. Для определения места ударения в слове система 
синтеза речи по тексту использует морфограмматический словарь.

 

 

Снятие  омонимии  (омографии). 

Снятие  омонимии  (омографии) 

представляет  из  себя  выбор  одной  из  нескольких  словоформ, 
соответствующих тому или иному слову текста. Эти словоформы могут 
отличаться  ударением  (

замок

  или 

замок

),  наличием  буквы  ё  (

все

  или 

всё

),  грамматическими  характеристиками  (

стали

  -  глагол  или 

существительное).  Выбор  словоформы  производится  с  помощью 
анализа  контекста:  лексического  окружения  слова,  а  также  его 
грамматической позиции в предложении. 

Просодический 

процессор

Просодическая 

обработка 

текста 

заключается в придании тексту интонационного оформления. Сюда относится 
деление  текста  на  просодические  единицы  –  синтагмы,  определение  длины 
пауз  между  синтагмами  и  выбор  интонационного  контура  для  каждой  из 
синтагм. 

Синтагма – основная единица реализации интонации. Характеризуется 

интонационной  и  смысловой  целостностью,  единым  мелодическим  и 
динамическим  контуром,  акцентно-ритмической  структурой.  Границы 
синтагмы  могут  маркироваться  паузами;  внутри  синтагмы  паузы 
недопустимы. В составе синтагмы выделяется главное слово, получающее т.н. 

синтагматическое ударение

, в то время как остальные словесные ударения 

могут  существенно  ослабляться  –  определяет  степень  централизации 
синтагмы (очень высокая для русского языка).

 

Деление предложения на синтагмы осуществляется в первую очередь с 

опорой  на  знаки  препинания.  В  большинстве  случаев  наличие  знаков 
препинания  является  надежным  сигналом  о  наличии  паузы.  В  то  же  время 
некоторые  отдельные  случаи,  такие  как  вводные  слова  (возможно,  к 
сожалению,  и  т.п.),  обрабатываются  по  особым  правилам,  поскольку 
выделение  их  запятыми  не  обязательно  обозначает  возможность  паузы  при 
чтении. Длинный отрезок предложения, не разделенный знаками препинания, 

25 

 

делится  на  синтагмы  по  особому  алгоритму,  включающему  в  себя  анализ 
синтаксических связей между словами. Деление на синтагмы сопровождается 
также  выбором  места  фразового  ударения,  то  есть  основного  ударения  в 
синтагме. В большинстве случаев в русском языке фразовое ударение падает 
на  последний  ударный  слог  синтагмы,  например, 

студент  читает  книгу

Однако  в  некоторых  случаях  фразовое  ударение  может  переноситься  на 
другой  слог,  например,  когда  последним  словом  в  синтагме  является 
местоимение: «Вы можете прочесть ее».  

Для  каждой  синтагмы,  выделенной  в  процессе  анализа  текста, 

выбирается  наиболее  подходящий  интонационный  контур  (ИК).  Набор 
интонационных контуров, используемый в системе синтеза речи, основан на 
стандартной  классификации  Е.А.Брызгуновой  [1]  и  включает  в  себя  такие 
интонационные  типы,  как  повествовательное  предложение,  общий  вопрос, 
частный  вопрос,  восклицание  и  т.п.  Выбор  ИК  осуществляется  на  основе 
знаков  препинания  (вопросительный  знак,  восклицательный  знак,  запятая, 
тире  и  т.п.),  а  также  лексического  содержания  предложения  (например, 
наличия вопросительных слов). 

Фонетический  процессор

.  Задачей  фонетического  процессора 

является: 

 

построение  транскрипции  по  правилам  и  учет  исключений 
транскрипции; 

 

вычисление  физических  параметров  интонации  для  синтагм 
синтезируемого текста. 

Акустический  процессор

.

 

Основная  часть  акустической  обработки  – 

оптимальный выбор звуковых элементов из базы диктора, осуществляющийся 
по  методу  Unit  Selection.  Далее  может  быть  произведена  модификация 
звуковых  элементов  по  частоте  основного  тона,  длительности  и  тембру,  а 
также  добавлены  звуковые  эффекты  (например,  с  помощью  инструментов 
ревербератора и эквалайзера)

.  

Структурно,  схему  взаимодействия  процессоров  можно  представить 

следующим образом (рис.2.1). 

В  качестве  формата  передачи  данных  между  процессорами  в  данной 

схеме  предполагается  XML-формат  данных.  XML  —  текстовый  формат, 
предназначенный  для  хранения  структурированных  данных  (взамен 
существующих  файлов  баз  данных),  для  обмена  информацией  между 
программами, а также для создания на его основе более специализированных 
языков разметки (например, XHTML), иногда называемых словарями. XML — 
это иерархическая структура, предназначенная для хранения любых данных, 
визуально  структура  может  быть  представлена  как  дерево.  Важнейшее 
обязательное  синтаксическое  требование —  то,  что  документ  имеет  только 
один корневой элемент. 

26 

 

 

3. ЛИНГВИСТИЧЕСКИЙ ТЕКСТОВЫЙ ПРОЦЕССОР 

3.1. 

Задачи лингвистического процессора 

Лингвистический  текстовый  процессор  производит  предварительную 

обработку  текста,  необходимую  для  построения  его  транскрипции  и 
дальнейшей  генерации  звучащей  речи.  Так,  в  потоке  текста  должны  быть 
выделены элементы, с которым система синтеза речи должна будет работать в 
дальнейшем: абзацы, предложения, слова, буквы и другие символы. При этом 
должна  быть  учтена  пользовательская  разметка  текста  (при  ее  наличии), 
выполненная,  например,  с  помощью  специализированных  тегов 

SSML

 

(Speech  Synthesis  Markup  Language).  Кроме  того,  орфографический  текст, 
который  должна  обработать  система  синтеза  речи,  сам  по  себе  содержит 
недостаточно  информации  для  создания  правильной 

транскрипции

 

(условной записи, по которой непосредственно будет формироваться звучание 
текста). 

Не  все  слова  орфографического  текста  могут  быть  «прочитаны» 

синтезатором  в  том  виде,  в  котором  они  представлены  изначально.  В 
естественных  текстах  часто  встречаются  следующие  виды  нестандартных 
записей: цифры; включения других алфавитов (для русского языка – в первую 
очередь,  латиница);  специальные  знаки,  не  являющиеся  ни  буквами,  ни 
цифрами;  сокращения  и  аббревиатуры  (акронимы);  и  др.  Все  эти  записи 
должны быть превращены в «обычные», стандартные слова языка, на котором 
производится синтез, или в подобные им записи (например, транслитерацию 
иного алфавита). 

Далее производится подготовка слов текста к транскрибированию. Для 

русского  языка  транскрипция  в  общем  случае  достаточно  регулярна  и 
осуществляется  по  заданным  правилам  на  отдельном  этапе  анализа  текста, 
однако  на  этапе  лингвистического  анализа  могут  быть  определены  места 
ударных  гласных,  а  также  наличие  буквы 

ё

,  которая  обычно  передается  на 

письме как 

е

. Для языков с нерегулярной орфографией, таких как английский, 

список транскрипций слов может быть задан в списке (словаре). Однако и в 
том и в другом случае основной проблемой являются слова, не найденные в 
словаре,  а  также  случаи,  когда  одному  написанию  соответствуют  два  или 
более разных слов (

омонимы

, например, «замОк-зАмок»). 

Слова,  различающиеся  звучанием,  но  пишущиеся  одинаково  (замОк-

зАмок), называются омографами; слова, пишущиеся и звучащие одинаково, но 
имеющие  разное  значение  и/или  разные  грамматические  характеристики, 
называются омонимами (например, печь – существительное и печь – глагол). 
Для  синтеза  речи  наиболее  важно  снятие  омографии,  однако  и  различение 
омонимов  может  быть  важным  для  грамматического  анализа  текста.  Часто 
омонимы и омографы объединяют под общим наименованием омонимов. 

27 

 

Рис. 2.1. Схема синтезатора речи 

 

Для выбора между омонимичными словоформами (

снятие омонимии

применяется как анализ лексического контекста, так и анализ грамматической 
структуры  предложения.  Для  определения  грамматических  характеристик 
слов 

может 

использоваться 

морфограмматический 

словарь 

либо 

статистические  методы  определения  части  речи  и  других  грамматических 
категорий  слова  (

Part-of-speech  tagging

).  Общая  схема  работы  процессора 

представлена на рис. 3.1. 

Итак, в задачи лингвистического процессора входит: 

 

первичная обработка текстовых данных и представление их в едином 
формате для последующей обработки; 

 

выделение предложений в тексте и разбиение их на отдельные слова; 

 

разметка  текста  на  буквы,  специальные  символы,  цифры  и  знаки 
пунктуации; 

Парсер входного текста

Лингвистический 

процессор

Просодический 

процессор

Фонетический процессор

Акустический процессор

Управляющие 

данные

Лингвистические 

базы и правила

Просодические 

базы и правила

Фонетические 

базы и правила

Акустические 

базы и правила

Входной текстовый поток

XML поток данных

XML поток данных

XML поток данных

XML поток данных

XML поток данных,

синтезированный звук

28 

 

 

учет разметки текста, проставленной пользователем; 

 

расшифровка  сокращений,  аббревиатур,  числительных  и  других 
нестандартных  записей,  поиск  и  исправление  орфографических 
ошибок и опечаток; 

 

определение места ударения и морфо-грамматических характеристик 
слов в предложении; 

 

снятие омонимии (омографии). 

Нормализация текста и графематический анализ

Обработка аббревиатур и иноязычных 

вставок

Морфо-грамматический словарь

Исправление ошибок

Расшифровка числовых последовательностей

Снятие омонимии

Лингвистические 

базы и правила

Данные 

управления

Парсер

XML поток данных 

Просодический процессор

XML поток данных

 

 

Рис. 3.1. Схема работы лингвистического процессора

 

3.2. 

Нормализация текста (графематический анализ) 

Задачи, входящие в нормализацию текста: 

 

выделять предложения в тексте; 

 

разбивать предложения на слова; 

 

разбивать  текст  на  буквы,  цифры,  знаки  пунктуации,  специальные 
символы; 

29 

 

 

учитывать  информацию,  проставленную  пользователем  (место 
ударения, наличие паузы и др.); 

 

расшифровывать  специальные  символы  (%,  *,  №...),  сокращения 
(«т.е.», «км/ч» и т.п.) и др.; 

 

выделять  специальные  форматы  записей  (дата,  время,  интернет-
адрес...). 

Рассмотрим эти задачи более подробно. 

3.2.1. 

Выделение предложений, слов, символов, знаков 

препинания 

Для правильного синтеза речи необходимым подготовительным этапом 

является деление текста на отрезки, которые будут впоследствии основными 
единицами синтеза. Это, прежде всего, слова и предложения. В самом первом 
приближении  словами  можно  считать  отрезки  текста  между  пробелами,  а 
предложениями  –  отрезки  текста  между  точками  и  другими  конечными 
знаками  препинания.  Однако  для  анализа  реальных  текстов  такого  подхода 
недостаточно. Рассмотрим примеры текста, поступающего на вход программы 
синтеза речи: 

Порядка  22%  от  объема  полученных  в  2011  году  средств  –  172  тыс. 

долларов – были переданы 39 благотворительным организациям

.

 

Write a cheque from acc 3949293 (code 84-15-56), for $114.34, sign it and 

take it down to 1134 St Andrews Dr, or else!!!!

 (пример взят из [21]). 

Анализируя эти примеры, можно сделать следующие наблюдения: 

-  Знаки  препинания,  как  правило,  не  отделены  пробелами  от  слов  и 

должны  быть  проанализированы  специальным  образом.  Далее  знаки 
препинания могут быть сохранены как отдельные символы либо сохраняться 
в виде флагов соответствующего слова. Следует учесть, что после слова может 
следовать  несколько  знаков  препинания.  Корректная  информация  о  знаках 
препинания крайне важна для синтеза речи, т.к. свидетельствует о смысловом 
и интонационном делении текста. 

-  Некоторые  другие  выражения,  объединенные  в  одно  графическое 

слово,  также  должны  быть  отделены  друг  от  друга  для  индивидуальной 
обработки (например, сочетания цифра+процент – «22%»). 

- Точки не всегда сигнализируют конец предложения; в русском языке 

точка часто является элементом сокращения – например, «тыс.». Необходим 
анализ  элемента,  который  оканчивается  точкой  (сокращение  это  или  нет)  и 
анализ  дальнейшего  контекста  (следует  ли  далее  слово  с  большой  буквы). 
Даже  при  учете  этих  факторов  могут  возникнуть  сложные  случаи,  которые 

30 

 

сложно решить без семантического анализа предложения (ср.: 

В 1868 г. Лев 

Толстой  закончил  «Войну  и  мир»

).  Точка  также  может  быть  элементом 

интернет-ссылки  или  адреса  электронной  почты  (mail.ru),  инициалов  (А.  С. 
Пушкин), а также дроби (1.5), даты (19.11.2012) и т.п. 

-  Изредка  встречаются  случаи,  когда  порядок  следования  элементов  в 

тексте должен быть изменен для правильного синтеза (ср.: 

$114.34

). 

3.2.2. 

Обработка пользовательской разметки 

В  большинстве  коммерческих  приложений  для  синтеза  речи 

пользователь  может  влиять  на  результат  синтеза  с  помощью  специальной 
разметки. Общепринятым форматом пользовательской разметки для синтеза 
речи является, как уже отмечалось ранее, SSML, основанный на XML. 

Язык  SSML  был  создан  рабочей  группой  консорциума  по  голосовым 

браузерам и позволяет программно контролировать самые разные параметры 
процесса синтеза речи.  

SSML  основан  на  языке  разметки  Java  Synthesis  Markup  Language 

(JSML),  разработанном  Sun  Microsystems.  Он  охватывает  практически  все 
аспекты  синтеза  речи,  хотя  в некоторых областях  остались  неопределенные 
аспекты,  поэтому  каждый  производитель  принимает  иной  вариант  языка. 
Кроме  того,  в  отсутствие  разметки,  синтезатор,  как  ожидается,  должен 
выполнить свое собственное толкование этого текста. Так SSML не является 
таким жестким в плане синтаксиса, как язык C, или даже HTML. 

С  помощью  тегов  SSML  могут  быть  определены  такие  параметры 

синтеза  речи,  как  выбор  языка,  голоса,  темпа,  тембра,  мест  пауз, 
произношения  слова  и  т.п.  Анализ  данных  тегов  производится  на  этапе 
разбора текста. 

3.2.3. 

Расшифровка нестандартных записей 

Можно выделить следующие типы нестандартных записей в тексте: 

1) Сокращения.  

-  Сокращения  –  элементы,  которые  должны  быть  заменены  на  полное 

слово или словосочетание. 

- Сокращение может быть из одного слова (км, стр.) или из нескольких 

(т.е., к. ф. н., до Р.Х.). 

- Сокращение может использоваться без точки (Гб, мск) либо содержать 

точку (одну или после нескольких частей, см. примеры выше), слеш (км/ч, в/ч, 
ж/д),  дефис  (кто-л.).  При  расшифровке  сокращения  эти  знаки  должны  быть 
исключены из дальнейшей обработки предложения. 

31 

 

При  расшифровке  сокращений  перед  разработчиком  системы  синтеза 

речи  встают  следующие  трудности.  Во-первых,  сокращения  зачастую 
неоднозначны:  например,  английское  «m»  может  обозначать  “million” 
(миллион) или “metre” (метр), русское «г.» - «город» или «год». Во-вторых, в 
языках с богатой морфологией, таких как  русский, приходится производить 
выбор  правильной  падежной  формы  слова  (например,  1  км=километр,  2 
км=километра, 5 км=километров, к 5 км=километрам и т.п.).  

2) Специальные знаки – знаки, не являющиеся ни буквами, ни цифрами, 

но нуждающиеся в словесной расшифровке ($, *, #, % и т.п.). Во многом такие 
знаки  ведут  себя  подобно  сокращениям  и  тоже  нуждаются  в  выборе 
правильной формы в зависимости от контекста (например, 1%, 2%, 5%...). 

3)  Цифровые  записи  –  это  цифры,  встречающиеся  в  естественных 

текстах,  которые  должны  быть  преобразованы  в  соответствующие  слова 
(числительные). 

-  Цифры  бывают  арабские  и  римские.  Римские  цифры  могут  быть 

преобразованы в арабские в соответствии с заданным алгоритмом. 

-  В  текстах  могут  встретиться  стандартные  последовательности  цифр 

или  слов  и  цифр,  требующие  чтения  по  определенному  формату.  Самые 
распространенные из таких форматов: дата, время, номер телефона, индекс. 
Они должны быть выявлены в процессе нормализации текста и «прочитаны» 
по заданным правилам (например, в дате типа 19.11.2012 цифра 11 заменяется 
названием месяца – «ноября», добавляется слово «года» и т.п.). 

-  Цифры,  не  подпадающие  под  заданные  форматы,  могут  обозначать 

количество  обозначаемых  предметов  (количественные  числительные, 
например,  «десять»)  или  номер  следования  предмета  (порядковые 
числительные,  например,  «десятый»).  При  расшифровке  числительных 
производится выбор между этими разрядами (например, «10 человек» или «10 
этаж»).  При  расшифровке  числительного,  записанного  в  виде  цифры  с 
аффиксом  (например,  «10-ый»,  «20-ти»,  в  английском:  2nd,  10th),  аффикс 
должен быть отброшен, а числительному придана соответствующая форма. 

- В русском языке расшифровка цифровых записей также сопряжена с 

выбором правильной формы (падежа и, для некоторых числительных, рода, 
например, «2 кота», «2 кошки», «2 кошкам» и т.п.). 

4)  Для  русского  языка:  латиница.  Хотя  система  синтеза  русской  речи 

прежде всего ориентирована на озвучивание текста, написанного кириллицей, 
однако  в  реальных  текстах  часто  встречаются  элементы,  написанные 
латинским  алфавитом.  Это  могут  быть  иностранные  имена  или  названия 
зарубежных фирм и товаров, адреса интернет-сайтов и электронной почты и 

32 

 

т.п.  Такие  элементы  должны  быть  транслитерированы  (

транслитерация

  – 

передача  слова,  написанного  иноязычным  алфавитом,  с  помощью  русских 
букв).  Правила  транслитерации  задаются  с  учетом  того, слова  какого  языка 
чаще  всего  могут  встретиться  в  синтезируемых  текстах  (чаще  всего  – 
английского). 

5)  Аббревиатуры  и  инициалы.  Аббревиатуры  (акронимы)  –  слова, 

образованные  путем  сложения  начальных  букв  или  слогов  исходного 
словосочетания,  которые  читаются  по  буквам  либо  как  единое  слово 
(например, 

АТС

ООО

ВАЗ

)  (в отличие  от  сокращений, которые при  чтении 

расшифровываются до исходного слова или словосочетания, например, 

км

 – 

километр, 

и  т.п.

  –  и  тому  подобное).  Выбор  способа  чтения  аббревиатуры 

задается по правилам, следует также определить, куда будет падать ударение 
в полученном слове. Инициалы тоже должны быть прочитаны как отдельные 
буквы  (при  этом  точки,  на  которые  заканчиваются инициалы,  удаляются  из 
дальнейшей обработки предложения).

 

3.3. 

Использование словарей в синтезе речи 

Машиночитаемые  электронные  словари  могут  выполнять  различную 

роль  в  системе  синтеза  речи.  Так,  в  английском  языке,  имеющем  бедную 
морфологию,  но  крайне  нерегулярную  орфографию,  словарь,  как  правило, 
содержит  список  словоформ  с  соответствующими  им  транскрипциями  (в 
словаре  может  также  содержаться  информация  о  части  речи  слова,  однако, 
поскольку  большинство  английских  словоформ  может  относиться  к 
различным  частям  речи,  то  определение  частей  речи  обычно  выделяется  в 
отдельный  модуль  программы).  Ниже  приводится  фрагмент  популярного 
словаря английского языка CMUDICT; каждая строка содержит в левой части 
словоформу, в правой части – ее транскрипцию в принятой в словаре нотации: 

SPEECH  S P IY1 CH 
SPEECHES  S P IY1 CH AH0 Z 
SPEECHIFY  S P IY1 CH AH0 F AY2 
SPEECHIFYING  S P IY1 CH AH0 F AY2 IH0 NG 
SPEECHLESS  S P IY1 CH L AH0 S 
 

Для русского языка не является целесообразным хранить в словаре всю 

информацию  о  транскрипции  каждой  формы,  поскольку,  во-первых, 
транскрипция  с  достаточной  степенью  достоверности  выводится  из 
орфографического облика слова, во-вторых, количество отдельных словоформ 
на то же количество лексем в русском языке значительно больше благодаря 
развитой  морфологии  (так,  у  английского  глагола  в  общем  случае  четыре 
формы,  а  у  русского  их  несколько  десятков,  если  учитывать  причастия).  В 
морфограмматическом  словаре  русского  языка  (например,  словарь  группы 
AOT  www.aot.ru)  слова  хранятся  в  форме  основ  и  соответствующих  им 
словоизменительных парадигм (то есть целиком каждая форма не хранится). 
При этом для каждой словоформы доступна следующая информация: 

33 

 

 

место ударения в данной словоформе;  

 

наличие  буквы 

ё

  (

ё

  должно  определяться,  даже  если  слово 

написано через 

е

);  

 

грамматические  характеристики  словоформы  (например,  род, 
число и падеж для существительного, лицо, число и время для 
глагола и т.п.);  

 

некоторые  сведения  о  семантике  (например,  является  ли  слово 
фамилией, географическим названием и т.п.).  

Ниже приводится фрагмент машиночитаемого словаря русского языка. 

Каждая  строка  словаря  содержит  основу  и  цифровой  или  буквенный  код, 
являющийся  ссылкой  на  определенную  словоизменительную  и  акцентную 
парадигму,  то  есть  на  набор  окончаний,  прибавляемых  к  данной  основе,  и 
место  ударения  для  каждой  полученной  словоформы  (сами  парадигмы 
хранятся в отдельной части словаря). 

синтез 67 29 Фа 
синтезатор 67 29 Фа 
синтезаторн 106 121  
синтезир 100 108 Уп 
 

При обработке текста в системе синтеза речи на вход модуля словаря 

поступает  нормализованный  текст.  Каждое  слово  этого  текста  ищется  в 
словаре, при нахождении ей присваиваются соответствующие характеристики 
(номер  ударного  гласного,  замена 

е

  на 

ё

,  грамматические  категории  и  т.п.) 

Если в словаре данная словоформа встречается более одного раза (например, 

дом

 – им.пад. ед.ч. и вин.пад. ед.ч.; 

берег

 – сущ., произносится с 

е

 и 

берёг

 – 

глагол, произносится с 

ё

), учитываются все словарные вхождения. 

3.4. 

Обработка незнакомых слов 

Каким бы объемным ни был словарь, использующийся в системе синтеза 

речи, тем не менее в текстах, как правило, будут встречаться слова, которые 
не  будут  находиться  в  словаре.  Однако  для  таких  слов  также  необходимо 
определить  место  ударения,  построить  транскрипцию  и  –  в  идеале  – 
определить грамматические характеристики. Для обработки незнакомых слов 
в системе синтеза речи могут использоваться следующие методы: 

1) Морфологический анализ и правила. Зачастую слова, не найденные в 

словаре, 

могут 

быть 

правильно 

интерпретированы 

с 

помощью 

морфологического

  анализа  (анализ  слова  на  составляющие  его  элементы  – 

основу  и  аффиксы),  который  позволяет  связать  незнакомое  слово  с  уже 
известным словом, содержащимся в словаре. Так, например, если в словаре 
нет слова 

супервыставка

, мы можем выделить в нем префикс 

супер

- и основу 

выставка

, которая в словаре есть. Если морфологический анализ не позволяет 

разложить слово на знакомые элементы, то место ударения или транскрипция 

34 

 

может  быть  выведено  с  помощью  правил  (например,  поиска  внутри  слова 
элементов, сигнализирующих о месте ударения, и т.п.). 

2) Статистические методы. При наличии достаточно большого словаря 

транскрипций  можно  обучить  статистическую  модель,  выводящую 
транскрипцию слова или место ударения автоматически. Этот способ удобен 
тем, что не требует участия эксперта для формирования правил, однако может 
давать  сбой  на  словах,  имеющих  редкий  для  обрабатываемого  языка 
орфографический  облик  (например,  иностранные  имена  и  названия,  часто 
встречающиеся среди незнакомых слов). 

Незнакомые  слова,  попадающиеся  в  текстах,  могут  быть  не  только 

обозначениями  каких-то  новых  предметов  и  понятий,  но  и  словарными 
словами, написанными с ошибкой или опечаткой (например, *интелект вместо 
«интеллект»,  *карова  вместо  «корова»).  Ошибки  в  подающихся  на  синтез 
словах могут быть исправлены как с помощью списков частотных ошибок и 
опечаток (либо просто добавления распространенных ошибочных вариантов, 
типа  *исскуство  вместо  «искусство»,  в  общий  словарь),  так  и  с  помощью 
правил,  проверяющих  наличие  распространенных  ошибок  (например,  для 
русского языка – написание двойных согласных, безударных гласных и т.п.).  

3.5. 

Снятие омонимии (омографии) 

Снятие  омонимии  –  одна  из  наиболее  важных  и  сложных  задач  для 

автоматического синтеза речи. Словоформы, имеющие одинаковое написание, 
но  разное  прочтение,  встречаются  во  многих  языках.  Однако  для  русского 
языка эта проблема особенно важна, поскольку количество омонимов очень 
велико. Омонимы в русском языке могут различаться ударением (например, 

ст

о

ит

-

сто

и

т

), а также наличием буквы 

ё

, которая в современной орфографии 

чаще  всего  передается  как 

е 

(

все

-

всё

),  либо  и  тем  и  другим  (

б

е

рег

-

бер

ё

г

). 

Омонимичные  словоформы  могут  иметь  одинаковые  грамматические 
признаки  (например, 

з

а

мок-зам

о

к

з

а

мка-замк

а…),  либо  различаться 

грамматическими  характеристиками.  В  последнем  случае  омонимичными 
могут быть как различные словоформы внутри одной парадигмы (например, 
род.п.  ед.ч.  –  им.п.  мн.ч.: 

облак

а

-

о

блака

стран

ы

-стр

а

ны

…),  так  и  формы 

разных  парадигм  (например,  существительное-инфинитив: 

вест

и

е

сти

проп

а

сть-пр

о

пасть

…). 

С  формальной  точки  зрения,  мы  считаем,  что  слово  в  тексте 

представляет  собой  омоним,  если  одному  слову  соответствует  несколько 
словарных  вхождений  (словоформ),  в  том  числе,  когда  варианты 
произношения этого слова различаются ударением или/и наличием буквы 

ё

. В 

задачи  модуля  снятия  омонимии  входит  выбор  правильного  вхождения  для 
данного контекста.  

Разрешение  омонимии,  как  и  расшифровка  специальных  обозначений, 

производится  при  помощи  анализа  контекста  [10,11].  На  уровне 
индивидуальных  слов-омонимов  производится  поиск  в  предложении 

 

 

 

 

 

 

 

содержание      ..      1       2         ..

 

 

///////////////////////////////////////