Открыть сервисСервис

Роботизированный голос

Роботизированный голос — синтезированная речь, воспроизводимая компьютером или специализированным устройством без участия живого человека. Термин охватывает как ранние системы преобразования текста в речь (Text-to-Speech, TTS), так и современные нейросетевые модели, воспроизводящие речь с высокой естественностью. Роботизированные голоса используются в телефонных роботах, навигаторах, голосовых ассистентах, системах оповещения, дубляже и медиаиндустрии.

История развития

Ранние системы

Первые опыты синтеза речи относятся к 1930-м годам. В 1939 году на Всемирной выставке в Нью-Йорке компания Bell Labs представила «Voder» — машину, способную воспроизводить речь при управлении оператором с клавиатуры. В 1961 году в Массачусетском технологическом институте был создан «Klatt Synthesizer», а в СССР в 1960-е годы под руководством Мстислава Келдыша и других исследователей велись работы по электронному моделированию речи.

Диджитайз и форманты

В 1970-е годы получили распространение системы, основанные на моделировании формант — резонансных частот речевого тракта. Компьютерный голос Stephen Hawking, сформированный системой DECtalk (1986), стал одним из самых узнаваемых роботизированных голосов XX века. DECtalk использовал метод декомпозиции речи на элементарные звуки и их последующего синтеза.

Нейросетевые модели

С 2016 года, после публикации архитектуры WaveNet от DeepMind, произошёл качественный скачок: нейросетевые модели стали генерировать речь, практически неотличимую от живой. В России разработками в этой области занимались компании «Яндекс» (голосовые ассистенты Алиса), «Сбер» (SberSpeech, голосовой помощник Салют) и ряд научных коллективов.

Принцип работы

Классический TTS

Классические системы текста в речь работают в два этапа:

  1. Анализ текста — определение произношения, ударений, интонации (графема-фонемное преобразование).
  2. Синтез речи — генерация звукового сигнала посредством формантного, динамического или статистического моделирования.

Нейросетевой синтез

Современные модели используют архитектуры трансформеров и генеративно-состязательные сети (GAN). Обучение происходит на больших корпусах записанной речи; модель учится предсказывать волновую форму или спектрограмму по текстовому входу. Ключевые технологии:

Классификация

ТипПримерХарактеристика
ФормантныйDECtalkМеханистичный, «роботизированный» звук
Диджитайз早期 системыСинтез из записанных слогов
Статистический (HMM)HTSПлавный, но «пластмассовый» голос
НейросетевойWaveNet, VITSЕстественный, близкий к живому

Применение

Телекоммуникации

Роботизированные голоса используются в автоответчиках, информационных роботах call-центров, системах экстренного оповещения. В России стандартные голоса для систем оповещения формируются на основе синтеза.

Голосовые подсказки в GPS-навигаторах («Яндекс.Навигатор», «Google Maps») исторически были роботизированными; современные системы используют нейросетевые голоса.

Медиа и развлечения

Роботизированные голоса применяются в дубляже, озвучке игр, подкастов, audiobook-сервисов («LitRes», «Bookmate»). В 2023 году в России появились сервисы, предлагающие клонирование голоса для корпоративного использования.

Помощь людям с нарушениями речи

Системы TTS являются вспомогательными технологиями для людей с афазией, буллзмом, повреждением голосовых связок. Пример — устройство Stephen Hawking, работавшее на базе DECtalk.

Юридические и этические аспекты

Клонирование голоса без согласия правообладателя вызывает правовые споры. В России в 2023 году обсуждались поправки в законодательство о защите персональных данных, касающиеся голосовых отпечатков. Использование роботизированных голосов в фейковых новостях и мошенничестве («звоны от имени родственников») стало предметом регулирования.

Интересные факты

  • В 2022 году голосовой помощник «Алиса» от «Яндекса» научился имитировать голоса пользователей по короткой записи.
  • Первый полностью автоматизированный роботизированный дубляж на русском языке был выполнен в 2020-е годы для ряда сериалов.
  • Голосовой помощник «Салют» от «Сбера» работает на собственной нейросетевой модели, обученной на русскоязычных данных.

Источники

  • «Речевые технологии» — учебник под ред. В.Н. Дружинина
  • Статьи о синтезе речи в журнале «Акустический журнал»
  • Материалы конференции Interspeech
  • Публикации DeepMind о WaveNet
  • Пресс-релизы «Яндекса» и «Сбера» о голосовых технологиях
Заметили ошибку или не согласны с информацией в статье? Напишите нам support@bfometr.ru