Открыть сервис

Whisper AI система распознавания речи

Whisper AI — автоматическая система распознавания речи (speech-to-text), разработанная компанией OpenAI и выпущенная в открытый доступ в сентябре 2022 года. Система способна транскрибировать аудио на 99 языках, переводить речь на английский язык, а также выполнять идентификацию языка и синхронный перевод. Архитектурно Whisper основан на глубокой нейронной сети типа encoder-decoder на базе трансформера, обученной на 680 тысячах часов размеченных аудиоданных.

История и предпосылки создания

Разработка Whisper велась в OpenAI под руководством исследователя Алекса Рэдфорда. Ключевой проблемой, которую предстояло решить, была низкая устойчивость существовавших систем распознавания речи к разнообразию реальных условий: фоновому шуму, акцентам, техническому качеству записи. Большинство коммерческих решений того времени обучались преимущественно на чистых студийных записях, что приводило к резкому падению точности в полевых условиях.

В отличие от конкурентов, команда OpenAI сделала ставку на сбор огромного массива разнородных данных из интернета. В обучающую выборку вошли записи с YouTube, подкасты, аудиокниги и фрагменты радиоэфиров. Это позволило модели получить представление о широком спектре разговорных стилей, диалектов и акустических условий. Обучение проводилось на кластере графических процессоров в течение нескольких месяцев; суммарные вычислительные затраты оцениваются в эквивалент порядка 4,2 миллиона долларов по ценам облачных вычислений 2022 года.

Исходный код, веса обученных моделей и документация были опубликованы на платформе GitHub под лицензией MIT, что допускает как некоммерческое, так и коммерческое использование. Это решение сделало Whisper одной из первых высококачественных открытых систем распознавания речи, доступных широкому кругу разработчиков.

Архитектура и принцип работы

Whisper представляет собой модель на основе архитектуры трансформер, состоящую из двух основных блоков: кодировщика (encoder) и декодировщика (decoder). Аудиосигнал предварительно преобразуется в последовательность логарифмических мел-спектрограмм — визуальных представлений звука, отражающих распределение энергии по частотам в зависимости от времени. Кодировщик обрабатывает эту последовательность и формирует скрытое представление, а декодировщик autoregressive-методом генерирует текстовую последовательность — токен за токеном.

Отличительной особенностью Whisper является его способность работать в нескольких режимах, задаваемых специальным управляющим токеном в начале входной последовательности:

  • транскрипция на исходном языке;
  • перевод на английский язык;
  • определение языка без транскрипции;
  • вывод временных меток для каждого сегмента текста.

Модель обучалась по принципу teacher forcing с использованием задач, объединяющих распознавание, перевод и идентификацию языка в едином процессе. Это позволило декодировщику научиться использовать контекстную информацию о языке и стиле речи для повышения точности.

Версии моделей

OpenAI выпустила несколько вариантов модели, различающихся размером, точностью и требованиями к вычислительным ресурсам. Все они имеют одинаковую архитектуру, но разное количество параметров:

ВерсияПараметрыТребования к памятиОтносительная скорость
Tiny39 млн~1 ГБ~32x
Base74 млн~1 ГБ~16x
Small244 млн~2 ГБ~6x
Medium769 млн~5 ГБ~2x
Large1550 млн~10 ГБ1x

Версия Large существует в трёх вариантах (Large-v1, Large-v2, Large-v3), каждый из которых отличается улучшенной точностью на определённых языках и типах речи. Для задач, требующих максимальной точности на русском языке, обычно рекомендуется Large-v3. Компания также выпустила дистиллированную версию Distil-Whisper, которая сохраняет около 99 % точности Large-v2 при вдвое меньшем размере и в шесть раз большей скорости.

Оценка точности

При тестировании на стандартных наборах данных Whisper показал результаты, сопоставимые или превосходящие коммерческие системы распознавания речи от Google, Amazon и Microsoft. Особенно заметно преимущество модели на записях с шумом, нестандартными акцентами и в условиях низкого качества звука. Однако на чистых студийных записях английской речи некоторые специализированные коммерческие системы по-прежнему демонстрируют несколько более высокую точность.

По оценкам разработчиков, частота ошибок (word error rate) на английском языке для версии Large составляет около 5–7 % на разнородных данных. Для русского языка точность несколько ниже, что объясняется меньшей долей русскоязычных данных в обучающей выборке (порядка 6 % от общего объёма). На практике модель хорошо справляется с литературной речью, но может допускать ошибки при транскрибации узкопрофессиональной терминологии, редких имён собственных и диалектных выражений.

Применение

Благодаря открытой лицензии и наличию версий для разных вычислительных мощностей, Whisper получил широкое распространение в самых разных областях:

  • Субтитрирование видео — автоматическое создание субтитров для видеохостингов, курсов и вебинаров.
  • Научные исследованиятранскрибация интервью, полевых записей и архивных аудиоматериалов в лингвистике, социологии и истории.
  • Медицина — автоматическое заполнение медицинских карт на основе голосовых заметок врачей.
  • Журналистика — расшифровка интервью и пресс-конференций.
  • Сурдоперевод — создание текстовых дублей для людей с нарушениями слуха.
  • Голосовые помощники — интеграция в системы умного дома и call-центры.

Whisper также используется как базовый компонент для дообучения специализированных моделей под конкретные домены — например, для распознавания медицинской или юридической терминологии. Существуют инструменты, позволяющие запускать Whisper локально на персональном компьютере без подключения к интернету, что важно для обработки конфиденциальных данных.

Ограничения и критика

Несмотря на высокую точность, Whisper имеет ряд ограничений. Модель не поддерживает потоковое распознавание в реальном времени в исходной версии — обработка выполняется сегментами по 30 секунд, что создаёт задержку. Для стриминговых приложений требуются дополнительные доработки.

Критике подвергается и склонность модели к галлюцинациям — генерации фрагментов текста, отсутствующих в аудио. Это особенно заметно на длинных паузах, при наличии фоновой музыки или неразборчивой речи. Исследователи отмечают, что модель может «додумывать» слова и даже целые предложения, что неприемлемо для задач, требующих дословной точности, например при создании стенограмм судебных заседаний.

Дополнительной проблемой является невозможность точной настройки модели на специфический словарь без потери общего качества. Кроме того, для запуска версии Large требуются значительные вычислительные ресурсы, что ограничивает её использование на мобильных устройствах и встраиваемых системах.

Влияние на индустрию

Появление Whisper стимулировало развитие открытых систем распознавания речи и привело к появлению множества производных проектов: библиотек для пакетной обработки аудио, веб-интерфейсов для транскрибации, плагинов для видеоредакторов. Модель стала стандартом де-факто для исследовательских задач, связанных с анализом устной речи, и активно используется в академических публикациях по компьютерной лингвистике.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →