Конкатенативный синтез¶
Конкатенативный синтез — это метод синтеза речи, основанный на соединении (конкатенации) заранее записанных фрагментов естественного человеческого голоса. В отличие от параметрического синтеза, который генерирует звук с помощью математических моделей, конкатенативный синтез использует реальные звуковые единицы (дифоны, трифоны, слоги, слова или фразы), извлечённые из большой базы аудиозаписей диктора. Результирующая речь обладает высоким естественным звучанием, но требует значительных вычислительных ресурсов и объёмов памяти для хранения базы.
¶История
Идея использования заранее записанных фрагментов речи для синтеза восходит к середине XX века. Первые системы конкатенативного синтеза появились в 1970-х годах, когда развитие цифровой записи и обработки сигналов позволило хранить и манипулировать звуковыми файлами. Однако практическое применение стало возможным лишь в 1990-х годах, с ростом вычислительной мощности компьютеров и объёмов памяти.
В 1980-х годах компания Bell Labs разработала систему синтеза речи на основе дифонов (фрагментов от середины одного звука до середины следующего). Этот подход, известный как «дифонный синтез», стал основой для многих коммерческих систем. В 1990-х годах появились системы, использующие трифоны (фрагменты из трёх звуков), что позволило лучше учитывать коартикуляцию — влияние соседних звуков друг на друга.
Современные системы конкатенативного синтеза, такие как Apple VoiceOver, Google Text-to-Speech (в ранних версиях) и Microsoft Speech API, активно применяются в голосовых помощниках, навигаторах и системах озвучивания текста. В России системы конкатенативного синтеза разрабатывались, в частности, компаниями «Центр речевых технологий» (ЦРТ) и «Яндекс» (для голосового помощника «Алиса»).
¶Принцип работы
Конкатенативный синтез состоит из нескольких этапов:
- Формирование базы данных (корпуса): запись речи диктора в контролируемых условиях (без шумов, с постоянной громкостью и интонацией). База обычно содержит несколько часов аудио, разбитого на фрагменты — единицы синтеза (дифоны, трифоны, слоги, слова). Каждый фрагмент индексируется по акустическим и фонетическим признакам (частота основного тона, длительность, энергия, контекст).
- Анализ входного текста: текст преобразуется в фонетическую транскрипцию (последовательность звуков) с учётом ударений, пауз, интонации. Для русского языка используются правила чтения, а также словари исключений (например, для слов с непредсказуемым ударением).
- Поиск подходящих фрагментов: для каждого звука или последовательности звуков из транскрипции выбирается наиболее подходящий фрагмент из базы. Критерии выбора включают:
- фонетический контекст (совпадение соседних звуков);
- акустические характеристики (частота основного тона, длительность, энергия);
- минимальные искажения при стыковке (чтобы избежать щелчков, перепадов громкости и тембра).
- Конкатенация (сшивание): выбранные фрагменты соединяются в единый аудиопоток. Для сглаживания стыков применяются методы обработки сигналов, такие как:
- сглаживание по огибающей (выравнивание громкости и спектра);
- фазовое выравнивание (синхронизация фаз сигналов);
- метод PSOLA (Pitch Synchronous Overlap and Add) — изменение высоты тона и длительности фрагментов без искажения тембра.
- Постобработка: добавление пауз, интонационных контуров, изменение темпа речи. В некоторых системах применяется дополнительная фильтрация для устранения артефактов.
¶Классификация
¶По типу единиц синтеза
- Дифонный синтез: использует фрагменты от середины одного звука до середины следующего. Требует базы из нескольких тысяч дифонов. Обеспечивает приемлемое качество, но может давать сбои на стыках сложных звуков.
- Трифонный синтез: использует фрагменты из трёх звуков (например, «а-б-в»). Лучше учитывает коартикуляцию, но база может содержать десятки тысяч трифонов.
- Слоговой синтез: использует целые слоги. Подходит для языков с простой слоговой структурой (например, японского).
- Словесный и фразовый синтез: использует целые слова или фразы. Применяется в системах с ограниченным словарём (например, в голосовых меню, навигаторах).
¶По способу хранения и поиска
- Полный корпус: хранятся все возможные фрагменты для данного диктора. Обеспечивает максимальное качество, но требует гигабайты памяти.
- Индексированный корпус: фрагменты хранятся в сжатом виде, а поиск осуществляется по индексам (акустическим, фонетическим). Экономит память, но увеличивает время обработки.
- Гибридный подход: комбинирует конкатенативный синтез с параметрическим (например, для редких звуков или эмоциональной окраски).
¶Преимущества и недостатки
¶Преимущества
- Высокая естественность: речь звучит как реальный голос человека, с интонациями, тембром и дыханием диктора.
- Низкая вычислительная нагрузка (на этапе синтеза): после построения базы данных синтез требует лишь поиска и сшивания фрагментов, что может выполняться в реальном времени на мобильных устройствах.
- Возможность сохранения индивидуальности диктора: голос остаётся узнаваемым, что важно для брендов (например, голос «Алисы» от «Яндекса»).
¶Недостатки
- Высокие требования к памяти и объёму базы: для качественного синтеза требуется несколько часов записи (до 10–20 часов для русского языка).
- Трудности с изменением интонации и эмоций: база записывается в нейтральном тоне, поэтому добавление радости, грусти или удивления требует дополнительной обработки или создания отдельных баз.
- Артефакты на стыках: при неправильном выборе фрагментов могут возникать щелчки, перепады громкости или тембра, особенно на сложных звукосочетаниях.
- Ограниченная гибкость: для добавления нового слова или голоса требуется перезапись части базы или полная запись нового диктора.
¶Применение
Конкатенативный синтез широко используется в:
- Голосовых помощниках: Siri (Apple), Google Assistant (в ранних версиях), «Алиса» (Яндекс).
- Навигационных системах: голосовые подсказки в GPS-навигаторах (например, «СитиГид»).
- Системах озвучивания текста: программы для чтения книг, экранные дикторы (например, JAWS, NVDA).
- Автоматизированных телефонных системах: голосовые меню, роботы-обзвонщики.
- Образовательных приложениях: озвучивание учебных материалов, языковые тренажёры.
¶Примеры систем
- Apple VoiceOver: использует конкатенативный синтез для русского языка с 2010-х годов. База включает несколько голосов (например, «Милена», «Ольга»).
- Microsoft Speech API (SAPI): в версиях до 2015 года применял конкатенативный синтез (голоса «Microsoft Anna», «Microsoft Zira»). Позже перешёл на нейросетевые методы.
- Яндекс.Речь: голос «Алиса» основан на конкатенативном синтезе с элементами параметрического (для эмоций). База записана диктором Татьяной Шитовой.
- Центр речевых технологий (ЦРТ): разрабатывает системы для русского языка, используемые в банках, транспорте и госуслугах.
¶Критика и ограничения
Основная критика конкатенативного синтеза связана с его негибкостью. Для создания нового голоса требуется запись диктора в студии, что занимает время и средства. Кроме того, система не может воспроизвести эмоциональную окраску, если она не была заложена в базу. В 2020-х годах конкатенативный синтез постепенно вытесняется нейросетевыми методами (например, WaveNet, Tacotron), которые генерируют речь с нуля и позволяют легко менять интонацию, тембр и скорость.
¶Интересные факты
- Первая коммерческая система конкатенативного синтеза для русского языка была создана в 1996 году компанией «МедиаЛингва».
- Для записи качественной базы требуется диктор с идеальной дикцией и без дефектов речи. Часто используются профессиональные дикторы радио и телевидения.
- В некоторых системах (например, в голосе «Алисы») используются фрагменты из нескольких дикторов, чтобы расширить интонационный диапазон.
- Конкатенативный синтез применяется не только для речи, но и для синтеза пения (например, в программе Vocaloid).
¶Источники
- «Речевой синтез: методы и алгоритмы» — учебное пособие, МГУ, 2018.
- «Синтез речи на основе конкатенации» — статья в журнале «Информационные технологии», 2015.
- Документация Microsoft Speech API (SAPI) — официальный сайт Microsoft.
- «Как работает синтез речи в Яндексе» — блог компании Яндекс, 2017.
- «Конкатенативный синтез речи: от теории к практике» — диссертация, СПбГУ, 2020.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →


