Открыть сервис

Speech to Text

Speech to Text (распознавание речи, автоматическое распознавание речи, ASR) — это технология, преобразующая звуковой сигнал человеческой речи в текстовую запись. Относится к области компьютерной лингвистики и обработки естественного языка (NLP). Ключевые характеристики: работа в реальном времени или с записью, поддержка различных языков и акцентов, адаптация к голосу диктора.

История развития

Ранние этапы (1950–1970-е)

Первые системы распознавания речи появились в 1950-х годах. В 1952 году в Bell Laboratories была создана система «Audrey», способная распознавать произнесённые цифры от 0 до 9. В 1960-х годах IBM разработала «Shoebox» — устройство, распознававшее 16 слов. Эти системы работали на основе акустических шаблонов и требовали чёткой дикции.

Эра статистических моделей (1980–2000-е)

Прорыв произошёл в 1980-х с внедрением скрытых марковских моделей (HMM). Это позволило обрабатывать непрерывную речь и учитывать контекст. В 1990-х появились коммерческие системы, такие как Dragon NaturallySpeaking (1997) для Windows. Точность распознавания достигала 95% при условии обучения на голосе пользователя.

Нейросетевой этап (2010-е — настоящее время)

С 2010-х годов доминируют глубокие нейронные сети (DNN), рекуррентные нейронные сети (RNN) и трансформеры. В 2015 году Google заявил о снижении частоты ошибок распознавания до 8% (по сравнению с 23% в 2013 году). Современные системы (например, OpenAI Whisper, 2022) используют архитектуру encoder-decoder с вниманием.

Принцип работы

Основные этапы

  1. Акустическая обработка: звуковой сигнал разбивается на короткие кадры (10–30 мс), извлекаются спектральные характеристики (MFCC, фильтры).
  2. Акустическое моделирование: нейросеть сопоставляет акустические признаки с фонемами (звуковыми единицами).
  3. Языковое моделирование: вероятностная модель предсказывает последовательность слов на основе грамматики и контекста.
  4. Декодирование: поиск наиболее вероятной текстовой гипотезы с использованием алгоритмов Витерби или beam search.

Современные архитектуры

  • End-to-end модели: преобразуют аудио напрямую в текст без промежуточных этапов (например, Listen, Attend and Spell — LAS).
  • Трансформеры: используют механизм внимания для учёта долгосрочных зависимостей (Whisper, Wav2Vec 2.0).
  • Гибридные системы: комбинируют HMM с нейросетями (Kaldi, DeepSpeech).

Классификация

По режиму работы

  • Онлайн-распознавание: обработка в реальном времени (голосовые помощники, диктовка).
  • Офлайн-распознавание: обработка предварительно записанного аудио (субтитры, транскрибация).

По типу речи

  • Зависимое от диктора: требует предварительного обучения на голосе конкретного человека.
  • Независимое от диктора: работает с любым голосом без настройки.

По объёму словаря

  • Малый словарь (до 100 слов): команды, цифры.
  • Средний словарь (до 10 000 слов): диктовка текстов.
  • Большой словарь (свыше 100 000 слов): универсальные системы.

Применение

Голосовые помощники

  • Яндекс Алиса (Россия): распознавание на русском языке с учётом региональных особенностей.
  • Google Assistant: поддерживает 40+ языков, использует модель Transformer.
  • Apple Siri: интеграция с экосистемой Apple, поддержка 21 языка.

Транскрибация и субтитры

  • Сервисы автоматической расшифровки: Otter.ai, Rev, Trint.
  • YouTube: автоматическое создание субтитров на основе ASR.
  • Телевидение: субтитры в прямом эфире (например, на каналах ВГТРК).

Медицина

  • Системы для врачей: Dragon Medical One — распознавание медицинской терминологии.
  • Диктовка протоколов: в российских клиниках используется «Речевая аналитика» от ЦРТ.

Промышленность и логистика

Образование

  • Инструменты для студентов: автоматическая запись лекций (Google Live Transcribe).
  • Изучение языков: приложения с обратной связью по произношению (ELSA Speak).

Технические характеристики

Метрики качества

  • Word Error Rate (WER): доля ошибок в распознанных словах. Для английского языка лучшие системы достигают WER 2–3% (LibriSpeech), для русского — 5–8% (Common Voice Russian).
  • Real-Time Factor (RTF): отношение времени обработки к длительности аудио. RTF < 1 означает работу быстрее реального времени.

Требования к оборудованию

  • Микрофон: частотный диапазон 100–8000 Гц, отношение сигнал/шум > 60 дБ.
  • Процессор: для нейросетевых моделей требуется GPU (NVIDIA Tesla V100 или современные CPU с AVX-512).
  • Память: модели типа Whisper large-v3 занимают ~3 ГБ видеопамяти.

Проблемы и ограничения

Акустические помехи

  • Фоновый шум (улица, вентиляция, музыка).
  • Эхо и реверберация.
  • Наложение голосов (диалог, конференция).

Лингвистические сложности

  • Омофоны: слова, звучащие одинаково, но пишущиеся по-разному («кот»/«код»).
  • Акценты и диалекты: например, южнорусское «г» фрикативное.
  • Смешение языков: код-свитчинг (русско-английский).

Конфиденциальность

  • Передача аудиоданных на серверы (облачные ASR).
  • Хранение записей голоса (политика Apple, Google, Яндекса).
  • Законодательство РФ: обработка биометрических данных регулируется 152-ФЗ «О персональных данных».

Развитие в России

Отечественные разработки

  • ЦРТ (Центр речевых технологий): система «Речевая аналитика» для колл-центров, распознавание 14 языков народов РФ.
  • Яндекс: ASR-модель на базе Transformer, интегрированная в Алису и Яндекс.Музыку.
  • SberDevices: система распознавания для умных колонок SberBoom, поддержка русского и татарского языков.
  • VK: голосовой ассистент «Маруся» с собственной ASR-моделью.

Государственные проекты

  • Единая биометрическая система (ЕБС): включает распознавание голоса для идентификации граждан.
  • Платформа «Госуслуги»: голосовое управление через Алису (пилотный проект 2023 года).

Перспективы

Мультимодальные системы

  • Объединение ASR с компьютерным зрением (анализ видео и речи).
  • Распознавание эмоций по голосу (эмоциональный ASR).

Улучшение для редких языков

  • Проект Common Voice (Mozilla) собирает данные для 100+ языков мира.
  • В России — поддержка языков народов РФ (татарский, башкирский, чеченский).

Интеграция с LLM

  • Использование больших языковых моделей (GPT, YandexGPT) для постобработки распознанного текста (исправление ошибок, пунктуация).
  • Голосовые интерфейсы нового поколения (например, ChatGPT Voice).

Источники

  • Jurafsky D., Martin J. H. Speech and Language Processing (3rd ed. draft).
  • Graves A. et al. Speech Recognition with Deep Recurrent Neural Networks (2013).
  • Radford A. et al. Robust Speech Recognition via Large-Scale Weak Supervision (Whisper, 2022).
  • Обзор рынка речевых технологий в России — ЦРТ, 2023.
  • Документация OpenAI Whisper, Google Cloud Speech-to-Text, Яндекс SpeechKit.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →