Открыть сервисСервис

Синтез и подмена голоса

Синтез речи — это технология автоматического преобразования текста в звучащую речь, а также создания или изменения голоса с помощью программных и аппаратно-программных средств. В более узком значении под «голосом ботом» понимают либо озвучивание текста синтезатором (text-to-speech, TTS), либо имитацию чужого голоса методами клонирования и конверсии, либо использование голосовых ботов в автоматизированных звонках и сервисах. Технология относится к области обработки сигналов, машинного обучения и речевых интерфейсов.

История

Первые эксперименты по машинному синтезу речи относятся к концу 1930-х годов: в 1939 году американский инженер Хомер Дадли представил устройство «Voder», управляемое оператором вручную. В 1961 году на выставке в Москве демонстрировался «Голосовой синтезатор» советского инженера, а в 1968 году советский учёный Александр Кожевников разработал одну из первых систем автоматического синтеза речи по тексту. В 1970-х годах в СССР велись работы по речевым интерфейсам в Институте проблем передачи информации.

Массовое распространение синтез речи получил в 1980–1990-е годы с появлением персональных компьютеров и программ для чтения текста вслух. С 2010-х годов переход на нейросетевые модели (WaveNet, Tacotron, а затем и более поздние архитектуры) резко повысил естественность звучания. В России собственные синтезаторы разрабатывают компании в сфере речевых технологий, а также научные коллективы, занимающиеся распознаванием и генерацией речи.

Виды технологий

  • Синтез по тексту (TTS) — преобразование письменного текста в звук. Применяется в голосовых помощниках, навигаторах, системах для людей с нарушениями зрения.
  • Клонирование голоса — построение модели, воспроизводящей тембр и манеру конкретного человека по образцу записи. Требует нескольких минут, а в современных системах — нескольких секунд аудио.
  • Конверсия голоса — изменение голоса говорящего в реальном времени с сохранением содержания речи.
  • Голосовые боты — автоматизированные системы, ведущие диалог с человеком по телефону или в приложении, использующие синтез и распознавание речи.

Устройство и принцип работы

Современный синтезатор включает несколько блоков: нормализацию текста (раскрытие чисел, аббревиатур, дат), фонетическую транскрипцию, акустическую модель и вокодер. Акустическая модель предсказывает параметры звука по последовательности фонем, вокодер превращает их в звуковую волну. Нейросетевые модели обучаются на больших корпусах записанной речи и позволяют получать интонацию, паузы и ударения, близкие к естественным.

Клонирование голоса строится на извлечении «эмбеддинга» говорящего — числового вектора, описывающего тембр. Достаточно короткого образца, чтобы синтезировать новые фразы этим голосом.

Применение

Риски и злоупотребления

Клонирование голоса создаёт угрозу мошенничества: известны случаи, когда злоумышленники имитировали голос родственника или руководителя, чтобы выманить деньги или получить доступ к данным. Возникают проблемы с авторскими правами на голос, с согласием человека на использование его тембра, с распространением поддельных аудио- и видеозаписей. В ряде стран обсуждается регулирование синтеза голоса и обязательная маркировка сгенерированного контента. В России вопросы защиты голоса как нематериального блага рассматриваются в рамках гражданского права.

Голосовые боты в обслуживании

Голосовые боты применяются в банках, телекоме, доставке, медицине. Они распознают речь абонента, определяют намерение и формируют ответ. Качество таких систем зависит от устойчивости распознавания к шуму, акценту и диалекту. Часто бот комбинирует заранее записанные фразы и синтез для гибких ответов.

Технические ограничения

Синтез пока не всегда точно передаёт эмоции, иронию, сложные интонации. Клонирование голоса чувствительно к качеству записи и посторонним шумам. Распознавание речи снижает точность при плохой связи и сильном фоне. Кроме того, синтез требует вычислительных ресурсов, хотя современные модели всё чаще работают на устройствах пользователя.

Правовой и этический аспект

Использование чужого голоса без согласия может нарушать право на неприкосновенность частной жизни и на имя. В ряде юрисдикций голос признаётся объектом, охраняемым законом. Для журналистики и медиа актуальна проблема достоверности: аудиозапись перестаёт быть надёжным доказательством. Разрабатываются методы детекции синтезированной речи и водяные знаки в аудио.

Перспективы

Развитие идёт в сторону повышения естественности, снижения задержки, работы офлайн и поддержки множества языков, включая языки народов России. Ожидается более широкое внедрение голосовых интерфейсов в бытовую технику, транспорт и промышленность, а также совершенствование средств защиты от подделок.

Источники: научные публикации по обработке речевых сигналов, материалы разработчиков речевых технологий, обзоры по машинному обучению, публикации по информационному праву.

Заметили ошибку или не согласны с информацией в статье? Напишите нам support@bfometr.ru