Открыть сервис

Whisper

Whisper — это автоматическая система распознавания речи (ASR), разработанная компанией OpenAI (организация, зарегистрированная в США; деятельность OpenAI на территории РФ не регулируется специальными запретами, однако компания Meta, также связанная с разработками в области ИИ, признана экстремистской и запрещена в РФ). Модель предназначена для преобразования аудиосигнала в текст, поддерживает многозыковую транскрипцию и перевод на английский язык. Система была представлена в сентябре 2022 года и отличается высокой точностью, устойчивостью к шумам и способностью обрабатывать речь на 99 языках, включая русский.

История и предпосылки создания

Разработка Whisper стала результатом многолетних исследований OpenAI в области глубокого обучения и обработки естественного языка. В отличие от многих коммерческих ASR-систем, которые обучались на ограниченных наборах данных (например, LibriSpeech или Common Voice), Whisper был обучен на супервизорном датасете объёмом 680 000 часов аудиозаписей. Этот датасет включал:

  • аудиокниги;
  • подкасты;
  • записи интервью;
  • видео с YouTube;
  • фрагменты телепередач;
  • записи с микрофонов в реальных условиях.

Ключевой особенностью обучения стало использование многозыковых данных: около 40% датасета составляли записи на английском языке, остальные 60% — на других языках, включая русский, китайский, арабский, испанский, французский и многие другие. Это позволило модели демонстрировать высокую точность на языках с разными фонетическими и грамматическими структурами.

Архитектура и технические характеристики

Whisper основан на архитектуре Transformer (трансформер), которая была впервые предложена в 2017 году для задач машинного перевода. В отличие от классических рекуррентных нейронных сетей (RNN) или свёрточных сетей (CNN), трансформеры используют механизм внимания (attention), что позволяет эффективно обрабатывать последовательности данных произвольной длины.

Основные компоненты модели:

  • Энкодер — преобразует входной аудиосигнал в последовательность скрытых представлений (embeddings). Аудио предварительно разбивается на фреймы длительностью 25 мс с шагом 10 мс, после чего преобразуется в спектрограмму (мел-спектрограмму) с помощью быстрого преобразования Фурье.
  • Декодер — генерирует текстовую последовательность по скрытым представлениям энкодера. Декодер может работать в двух режимах:
  • транскрипция — вывод текста на том же языке, что и входная речь;
  • перевод — вывод текста только на английском языке, независимо от языка входной речи.

Размеры моделей:

OpenAI выпустила несколько версий Whisper, различающихся по количеству параметров и требованиям к вычислительным ресурсам:

НазваниеПараметрыRAM (GPU)Скорость (относительно реального времени)
tiny39 млн~1 ГБ~10x
base74 млн~1 ГБ~7x
small244 млн~2 ГБ~4x
medium769 млн~5 ГБ~2x
large1,55 млрд~10 ГБ~1x

Модель large считается наиболее точной, но требует значительных вычислительных ресурсов. Для работы на CPU или в облачных средах с ограниченной памятью рекомендуется использовать версии tiny или small.

Языковая поддержка и точность

Whisper поддерживает 99 языков, включая русский, украинский, белорусский, казахский, татарский, башкирский, чеченский и другие языки народов России. Точность распознавания зависит от языка и качества записи. По данным OpenAI, на английском языке модель достигает уровня ошибок (Word Error Rate, WER) около 5–7% на чистых записях и 10–15% на зашумлённых. Для русского языка WER составляет примерно 8–12% на стандартных тестовых наборах (например, Common Voice Russian).

Особенности распознавания русского языка:

  • Модель корректно обрабатывает падежные окончания, склонения и спряжения, характерные для русского языка.
  • Устойчива к диалектам и акцентам (например, южнорусский, сибирский, речь носителей с кавказским акцентом).
  • Плохо распознаёт специфическую лексику (профессионализмы, архаизмы, неологизмы) и имена собственные, если они не встречались в обучающем датасете.

Применение

Whisper нашёл широкое применение в различных областях, где требуется автоматическая транскрипция речи:

Научные исследования

  • Транскрипция интервью и фокус-групп в социологии и лингвистике.
  • Обработка аудиозаписей полевых исследований (антропология, диалектология).
  • Создание корпусов устной речи для обучения других моделей.

Медицина

  • Автоматическая запись врачебных приёмов и создание электронных медицинских карт.
  • Транскрипция диктофонных записей лекций и конференций.

Образование

  • Создание субтитров к видеолекциям и вебинарам.
  • Перевод устных выступлений на английский язык для международных аудиторий.

Бизнес и право

  • Транскрипция переговоров, совещаний, судебных заседаний.
  • Автоматическая обработка звонков в колл-центрах (с последующим анализом тональности).

Медиа и контент

  • Создание субтитров к видео на YouTube, TikTok, VK Видео.
  • Перевод и транскрипция подкастов.

Ограничения и критика

Несмотря на высокую точность, Whisper имеет ряд ограничений:

  • Необходимость чистого аудио — при сильном фоновом шуме (улица, стройка, музыка) качество распознавания резко падает, особенно для языков с малым количеством обучающих данных.
  • Отсутствие поддержки диалектов — модель обучена на литературных вариантах языков, поэтому диалектная речь (например, поморский говор, сибирские говоры) распознаётся хуже.
  • Проблемы с именами и терминами — модель часто ошибается в написании имён собственных, названий компаний, специфических терминов (например, медицинских или юридических).
  • Ресурсоёмкость — версия large требует мощного GPU (например, NVIDIA A100) для работы в реальном времени, что ограничивает её использование на массовых устройствах.
  • Этические риски — возможность использования для массовой прослушки и слежки, особенно в странах с авторитарными режимами. OpenAI не внедрила в модель механизмы обнаружения и блокировки конфиденциальной информации (например, номеров кредитных карт или паролей).

Лицензирование и доступность

Whisper распространяется по лицензии MIT License, что позволяет свободно использовать, модифицировать и распространять модель как в некоммерческих, так и в коммерческих целях. Исходный код и предобученные веса доступны в репозитории OpenAI на GitHub. Для использования на русском языке не требуется специальных разрешений или лицензий.

Интересные факты

  • Whisper способен распознавать речь даже на языках, которые не были явно включены в обучающий датасет, благодаря механизму «zero-shot» (обучение без примеров). Например, модель может частично распознавать редкие языки, если они имеют общие корни с обучающими языками.
  • В 2023 году сообщество разработчиков создало модификации Whisper, оптимизированные для работы на мобильных устройствах (Whisper.cpp, Whisper-tiny на ARM-процессорах).
  • Модель используется в некоторых российских стартапах для автоматической транскрипции звонков и создания субтитров, однако официальных данных о масштабах внедрения нет.

Источники

  • OpenAI. «Whisper: Robust Speech Recognition via Large-Scale Weak Supervision». arXiv:2212.04356, 2022.
  • Radford, A., Kim, J. W., Xu, T., et al. «Robust Speech Recognition via Large-Scale Weak Supervision». OpenAI, 2022.
  • Документация Whisper на GitHub: https://github.com/openai/whisper (дата обращения: 2023).
  • Common Voice Dataset (Mozilla Foundation) — тестовые наборы для русского языка.
  • Анализ точности Whisper на русском языке: «Сравнение ASR-систем для русского языка», журнал «Компьютерная лингвистика и интеллектуальные технологии», 2023.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →