Открыть сервисСервис

Голоса бота в интернете

Голоса бота — это совокупность приёмов имитации человеческого голоса и речевого поведения, применяемых автоматизированными системами (ботами) в телефонных звонках, голосовых сообщениях и синтезе речи. Термин охватывает как техническую сторону — синтез и клонирование голоса, — так и социальную: использование звучащего «человеческого» голоса для автоматизированного обзвона, мошенничества, политической агитации и массовых коммуникаций. Явление стало массовым на рубеже 2010–2020-х годов с развитием нейросетевого синтеза речи и генеративных моделей.

Технологическая основа

До 2010-х годов автоматический синтез речи строился на конкатенации (склейке) заранее записанных фрагментов и правилах фонетики. Такие системы звучали механически и легко распознавались на слух. Перелом произошёл с внедрением нейросетевых моделей: сначала параметрического синтеза (Tacotron, WaveNet), затем — диффузионных и потоковых генераторов.

Современный конвейер синтеза включает несколько этапов:

Именно клонирование сделало возможным воспроизведение голоса конкретного лица — политика, руководителя, родственника. Для этого достаточно публичной записи выступления или голосового сообщения.

Применение

Легитимные сценарии

  • Голосовые ассистенты и синтез речи для людей с нарушениями зрения или речи.
  • Озвучивание аудиокниг, навигации, справочных служб.
  • Автоматические обзвоны в банках, медицине, логистике (напоминания, подтверждения).
  • Восстановление голоса после операций на гортани.

Злоупотребления

  • Телефонное мошенничество: имитация голоса родственника с просьбой о переводе денег.
  • Фейковые звонки от имени руководителей — схема «директор просит срочно перевести средства».
  • Массовый обзвон с политической или рекламной агитацией.
  • Шантаж и диффамация с использованием сфабрикованных аудиозаписей.
  • Обход биометрической идентификации по голосу в банковских колл-центрах.

Признаки синтезированной речи

Полностью надёжного способа отличить синтез от живого голоса не существует, однако выделяют характерные признаки:

ПризнакПроявление
ИнтонацияРовная, без естественных пауз и оговорок
ДыханиеОтсутствие вдохов, шумов
ФонИдеально чистый сигнал либо однотипный шум
РеакцияНет ответа на перебивание, уточняющие вопросы
АртефактыМеталлический оттенок, «плывущие» согласные

С развитием моделей эти признаки ослабевают, поэтому растёт значение технических средств детекции — анализа спектра, проверки артефактов сжатия, сопоставления с базой известных голосов.

Регулирование в России

В Российской Федерации прямое регулирование синтеза голоса пока фрагментарно. Отдельные нормы касаются:

  • защиты персональных данных (голос относится к биометрическим персональным данным);
  • противодействия мошенничеству (статьи УК РФ о мошенничестве и неправомерном доступе к информации);
  • рекламы и электоральных коммуникаций — требования к маркировке и достоверности.

Банки России внедряют антифрод-системы, анализирующие голосовые обращения, и предупреждают клиентов о схемах с подделкой голоса. Обсуждается введение обязательной маркировки синтезированного аудио и видео (так называемых дипфейков).

Социальные последствия

Доступность клонирования голоса снижает доверие к аудиосообщениям как к доказательству. Возникают риски:

  • рост успешности социальной инженерии;
  • эрозия доверия к голосовым каналам связи;
  • сложность проверки аудиозаписей в судебной практике;
  • давление на публичных лиц, чьи голоса легко воспроизводятся.

Ответом становятся как технические решения (детекторы синтеза, «водяные знаки» в аудио), так и организационные: подтверждение финансовых операций по нескольким каналам, отказ от голосовой идентификации как единственного фактора.

Интересные факты

  • Первые эксперименты по синтезу речи относятся к XVIII веку: в 1779 году российский учёный Христиан Кратценштейн создал механическую модель человеческого голоса, воспроизводившую гласные звуки.
  • В 1961 году на ЭВМ IBM 7094 впервые прозвучала синтезированная песня «Daisy Bell» — этот эпизод вошёл в фильм «Космическая одиссея 2001 года».
  • Для клонирования голоса в ряде современных моделей достаточно образца длительностью около трёх секунд.

Критика и ограничения

Основные претензии к технологии связаны с этической стороной: клонирование голоса без согласия человека нарушает его права на неприкосновенность личности и может использоваться для клеветы. Технические детекторы синтеза дают ложноположительные и ложноотрицательные результаты, а их эффективность падает по мере совершенствования генераторов. Единых международных стандартов маркировки синтезированного аудио на 2020-е годы не выработано.

Источники: научные публикации по нейросетевому синтезу речи (Tacotron, WaveNet), материалы по информационной безопасности и антифроду, нормативные акты РФ о персональных данных и рекламе, исторические работы по раннему синтезу речи.

Заметили ошибку или не согласны с информацией в статье? Напишите нам support@bfometr.ru