Открыть сервис

Мел-кепстральные коэффициенты

Мел-кепстральные коэффициенты (MFCC, от англ. Mel-frequency cepstral coefficients) — это набор признаков, широко используемый в обработке речевых сигналов и распознавании речи. Они представляют собой компактное представление спектральной огибающей звукового сигнала, основанное на восприятии высоты звука человеческим ухом (мел-шкала). MFCC являются стандартным инструментом в системах автоматического распознавания речи (ASR), идентификации диктора, анализа эмоций и других задачах акустического анализа.

История

Разработка мел-кепстральных коэффициентов связана с развитием теории кепстрального анализа в 1960-х годах. Кепстральный анализ, введённый Б. П. Богертом, М. Хили и Дж. Тьюки, изначально применялся для обработки сейсмических сигналов и эхолокации. В 1970-х годах исследователи начали применять кепстральные методы к речевым сигналам, что привело к созданию линейного предсказательного кодирования (LPC) и кепстральных коэффициентов LPC.

В 1980 году Стивен Дэвис и Пол Мермельштейн из Bell Labs предложили использовать мел-шкалу, основанную на психоакустических исследованиях, для взвешивания спектральных энергий перед кепстральным преобразованием. Это позволило создать признаки, более устойчивые к вариациям речи и шуму, чем традиционные кепстральные коэффициенты. С тех пор MFCC стали основой большинства систем распознавания речи, включая ранние коммерческие продукты, такие как Dragon NaturallySpeaking.

Принцип вычисления

Вычисление MFCC включает несколько этапов, преобразующих исходный звуковой сигнал в набор коэффициентов.

Предварительная обработка

Сигнал разбивается на короткие кадры (обычно 20–40 мс) с перекрытием (например, 10 мс). Каждый кадр умножается на оконную функцию (например, окно Хэмминга) для уменьшения спектральных утечек.

Быстрое преобразование Фурье (БПФ)

Для каждого кадра вычисляется спектр мощности с помощью БПФ. Получается набор амплитуд для различных частот.

Применение мел-фильтров

Спектральные энергии группируются по частотным полосам, соответствующим мел-шкале. Мел-шкала — это нелинейная шкала высоты звука, приближающая восприятие человеческого уха: она линейна для низких частот (до 1000 Гц) и логарифмична для высоких. Для преобразования частоты \( f \) в мелы используется формула: \[ m = 2595 \log_{10}\left(1 + \frac{f}{700}\right) \] Обычно применяется набор из 20–40 треугольных фильтров, равномерно расположенных на мел-шкале. Для каждого фильтра вычисляется логарифм суммы энергий в его полосе.

Логарифмирование

Логарифмирование амплитуд фильтров имитирует нелинейность громкостного восприятия (закон Вебера — Фехнера).

Дискретное косинусное преобразование (ДКП)

Логарифмированные энергии фильтров преобразуются с помощью ДКП. Это даёт набор коэффициентов, где первые несколько (обычно 12–13) содержат основную информацию о спектральной огибающей, а последние — высокочастотные детали, часто отбрасываемые как шум.

Дельта- и дельта-дельта коэффициенты

Для учёта динамики речи добавляются первые и вторые производные MFCC по времени (дельта- и дельта-дельта коэффициенты). Они вычисляются как разности между соседними кадрами, что позволяет моделировать изменения спектра во времени.

Характеристики

MFCC обладают рядом свойств, делающих их эффективными для речевых задач:

  • Устойчивость к шуму: логарифмирование и ДКП снижают влияние аддитивного шума.
  • Компактность: 12–20 коэффициентов заменяют сотни спектральных отсчётов.
  • Инвариантность к высоте тона: мел-шкала и кепстральное преобразование отделяют спектральную огибающую (тембр) от гармонической структуры (высоты тона).
  • Психологическая обоснованность: соответствие восприятию звука человеком.

Ограничения включают чувствительность к изменениям канала передачи (например, микрофона) и необходимость в достаточном количестве данных для обучения моделей.

Применение

Распознавание речи

MFCC являются основным признаком в большинстве систем ASR, включая скрытые марковские модели (HMM) и глубокие нейронные сети (DNN). Они используются в голосовых помощниках (например, «Алиса» от Яндекса, Siri от Apple), системах диктовки и автоматическом субтитровании.

Идентификация диктора

В системах верификации и идентификации диктора MFCC извлекаются из голосового слепка и сравниваются с эталонными шаблонами. Это применяется в биометрической аутентификации, криминалистике и системах доступа.

Анализ эмоций

MFCC используются для классификации эмоционального состояния по голосу, например, в системах психологического тестирования или оценки качества обслуживания.

Музыкальный анализ

В музыковедении MFCC применяются для классификации жанров, поиска похожих треков и анализа тембра инструментов.

Медицина

MFCC анализируются для диагностики заболеваний голосовых связок, болезни Паркинсона и других нарушений, влияющих на речь.

Варианты и модификации

Существуют модификации MFCC, адаптированные под конкретные задачи:

  • PNCC (Power-Normalized Cepstral Coefficients) — улучшенная версия с нормализацией мощности, устойчивая к шуму.
  • Gammatone Cepstral Coefficients (GTCC) — используют гамматоновые фильтры, имитирующие базилярную мембрану уха.
  • Fbank (Filterbank energies) — логарифмированные энергии фильтров без ДКП, часто применяемые в нейронных сетях.
  • LPC-MFCC — комбинация линейного предсказательного кодирования и мел-фильтрации.

Критика

Основные недостатки MFCC:

  • Зависимость от акустической среды: шум, реверберация и искажения канала снижают точность.
  • Потеря информации: ДКП отбрасывает корреляции между фильтрами, что может быть полезно для некоторых задач.
  • Неоптимальность для глубоких нейронных сетей: современные системы ASR часто используют сырые спектрограммы или Fbank, так как нейросети могут самостоятельно извлекать признаки.

Тем не менее, MFCC остаются стандартом для сравнения и начальной обработки сигналов.

Интересные факты

  • Название «кепстральный» происходит от перестановки букв в слове «спектральный» (spectral → cepstral), что отражает обратное преобразование.
  • Количество MFCC обычно выбирается равным 12–13, так как это соответствует числу критических полос слуха в диапазоне речи.
  • В системах распознавания речи на русском языке MFCC часто комбинируются с признаками, учитывающими особенности русской фонетики (например, палатализацию).

Источники

  • Davis, S. B., & Mermelstein, P. (1980). Comparison of parametric representations for monosyllabic word recognition in continuously spoken sentences. IEEE Transactions on Acoustics, Speech, and Signal Processing, 28(4), 357–366.
  • Rabiner, L. R., & Juang, B. H. (1993). Fundamentals of Speech Recognition. Prentice Hall.
  • Huang, X., Acero, A., & Hon, H. W. (2001). Spoken Language Processing: A Guide to Theory, Algorithm, and System Development. Prentice Hall.
  • Stevens, S. S., Volkmann, J., & Newman, E. B. (1937). A scale for the measurement of the psychological magnitude pitch. Journal of the Acoustical Society of America, 8(3), 185–190.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →