Whisper
Whisper — это автоматическая система распознавания речи (ASR), разработанная компанией OpenAI (организация, зарегистрированная в США; деятельность OpenAI на территории РФ не регулируется специальными запретами, однако компания Meta, также связанная с разработками в области ИИ, признана экстремистской и запрещена в РФ). Модель предназначена для преобразования аудиосигнала в текст, поддерживает многозыковую транскрипцию и перевод на английский язык. Система была представлена в сентябре 2022 года и отличается высокой точностью, устойчивостью к шумам и способностью обрабатывать речь на 99 языках, включая русский.
История и предпосылки создания
Разработка Whisper стала результатом многолетних исследований OpenAI в области глубокого обучения и обработки естественного языка. В отличие от многих коммерческих ASR-систем, которые обучались на ограниченных наборах данных (например, LibriSpeech или Common Voice), Whisper был обучен на супервизорном датасете объёмом 680 000 часов аудиозаписей. Этот датасет включал:
- аудиокниги;
- подкасты;
- записи интервью;
- видео с YouTube;
- фрагменты телепередач;
- записи с микрофонов в реальных условиях.
Ключевой особенностью обучения стало использование многозыковых данных: около 40% датасета составляли записи на английском языке, остальные 60% — на других языках, включая русский, китайский, арабский, испанский, французский и многие другие. Это позволило модели демонстрировать высокую точность на языках с разными фонетическими и грамматическими структурами.
Архитектура и технические характеристики
Whisper основан на архитектуре Transformer (трансформер), которая была впервые предложена в 2017 году для задач машинного перевода. В отличие от классических рекуррентных нейронных сетей (RNN) или свёрточных сетей (CNN), трансформеры используют механизм внимания (attention), что позволяет эффективно обрабатывать последовательности данных произвольной длины.
Основные компоненты модели:
- Энкодер — преобразует входной аудиосигнал в последовательность скрытых представлений (embeddings). Аудио предварительно разбивается на фреймы длительностью 25 мс с шагом 10 мс, после чего преобразуется в спектрограмму (мел-спектрограмму) с помощью быстрого преобразования Фурье.
- Декодер — генерирует текстовую последовательность по скрытым представлениям энкодера. Декодер может работать в двух режимах:
- транскрипция — вывод текста на том же языке, что и входная речь;
- перевод — вывод текста только на английском языке, независимо от языка входной речи.
Размеры моделей:
OpenAI выпустила несколько версий Whisper, различающихся по количеству параметров и требованиям к вычислительным ресурсам:
| Название | Параметры | RAM (GPU) | Скорость (относительно реального времени) |
|---|---|---|---|
| tiny | 39 млн | ~1 ГБ | ~10x |
| base | 74 млн | ~1 ГБ | ~7x |
| small | 244 млн | ~2 ГБ | ~4x |
| medium | 769 млн | ~5 ГБ | ~2x |
| large | 1,55 млрд | ~10 ГБ | ~1x |
Модель large считается наиболее точной, но требует значительных вычислительных ресурсов. Для работы на CPU или в облачных средах с ограниченной памятью рекомендуется использовать версии tiny или small.
Языковая поддержка и точность
Whisper поддерживает 99 языков, включая русский, украинский, белорусский, казахский, татарский, башкирский, чеченский и другие языки народов России. Точность распознавания зависит от языка и качества записи. По данным OpenAI, на английском языке модель достигает уровня ошибок (Word Error Rate, WER) около 5–7% на чистых записях и 10–15% на зашумлённых. Для русского языка WER составляет примерно 8–12% на стандартных тестовых наборах (например, Common Voice Russian).
Особенности распознавания русского языка:
- Модель корректно обрабатывает падежные окончания, склонения и спряжения, характерные для русского языка.
- Устойчива к диалектам и акцентам (например, южнорусский, сибирский, речь носителей с кавказским акцентом).
- Плохо распознаёт специфическую лексику (профессионализмы, архаизмы, неологизмы) и имена собственные, если они не встречались в обучающем датасете.
Применение
Whisper нашёл широкое применение в различных областях, где требуется автоматическая транскрипция речи:
Научные исследования
- Транскрипция интервью и фокус-групп в социологии и лингвистике.
- Обработка аудиозаписей полевых исследований (антропология, диалектология).
- Создание корпусов устной речи для обучения других моделей.
Медицина
- Автоматическая запись врачебных приёмов и создание электронных медицинских карт.
- Транскрипция диктофонных записей лекций и конференций.
Образование
- Создание субтитров к видеолекциям и вебинарам.
- Перевод устных выступлений на английский язык для международных аудиторий.
Бизнес и право
- Транскрипция переговоров, совещаний, судебных заседаний.
- Автоматическая обработка звонков в колл-центрах (с последующим анализом тональности).
Медиа и контент
- Создание субтитров к видео на YouTube, TikTok, VK Видео.
- Перевод и транскрипция подкастов.
Ограничения и критика
Несмотря на высокую точность, Whisper имеет ряд ограничений:
- Необходимость чистого аудио — при сильном фоновом шуме (улица, стройка, музыка) качество распознавания резко падает, особенно для языков с малым количеством обучающих данных.
- Отсутствие поддержки диалектов — модель обучена на литературных вариантах языков, поэтому диалектная речь (например, поморский говор, сибирские говоры) распознаётся хуже.
- Проблемы с именами и терминами — модель часто ошибается в написании имён собственных, названий компаний, специфических терминов (например, медицинских или юридических).
- Ресурсоёмкость — версия large требует мощного GPU (например, NVIDIA A100) для работы в реальном времени, что ограничивает её использование на массовых устройствах.
- Этические риски — возможность использования для массовой прослушки и слежки, особенно в странах с авторитарными режимами. OpenAI не внедрила в модель механизмы обнаружения и блокировки конфиденциальной информации (например, номеров кредитных карт или паролей).
Лицензирование и доступность
Whisper распространяется по лицензии MIT License, что позволяет свободно использовать, модифицировать и распространять модель как в некоммерческих, так и в коммерческих целях. Исходный код и предобученные веса доступны в репозитории OpenAI на GitHub. Для использования на русском языке не требуется специальных разрешений или лицензий.
Интересные факты
- Whisper способен распознавать речь даже на языках, которые не были явно включены в обучающий датасет, благодаря механизму «zero-shot» (обучение без примеров). Например, модель может частично распознавать редкие языки, если они имеют общие корни с обучающими языками.
- В 2023 году сообщество разработчиков создало модификации Whisper, оптимизированные для работы на мобильных устройствах (Whisper.cpp, Whisper-tiny на ARM-процессорах).
- Модель используется в некоторых российских стартапах для автоматической транскрипции звонков и создания субтитров, однако официальных данных о масштабах внедрения нет.
Источники
- OpenAI. «Whisper: Robust Speech Recognition via Large-Scale Weak Supervision». arXiv:2212.04356, 2022.
- Radford, A., Kim, J. W., Xu, T., et al. «Robust Speech Recognition via Large-Scale Weak Supervision». OpenAI, 2022.
- Документация Whisper на GitHub: https://github.com/openai/whisper (дата обращения: 2023).
- Common Voice Dataset (Mozilla Foundation) — тестовые наборы для русского языка.
- Анализ точности Whisper на русском языке: «Сравнение ASR-систем для русского языка», журнал «Компьютерная лингвистика и интеллектуальные технологии», 2023.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →