Мел-кепстральные коэффициенты¶
Мел-кепстральные коэффициенты (MFCC, от англ. Mel-frequency cepstral coefficients) — это набор признаков, широко используемый в обработке речевых сигналов и распознавании речи. Они представляют собой компактное представление спектральной огибающей звукового сигнала, основанное на восприятии высоты звука человеческим ухом (мел-шкала). MFCC являются стандартным инструментом в системах автоматического распознавания речи (ASR), идентификации диктора, анализа эмоций и других задачах акустического анализа.
¶История
Разработка мел-кепстральных коэффициентов связана с развитием теории кепстрального анализа в 1960-х годах. Кепстральный анализ, введённый Б. П. Богертом, М. Хили и Дж. Тьюки, изначально применялся для обработки сейсмических сигналов и эхолокации. В 1970-х годах исследователи начали применять кепстральные методы к речевым сигналам, что привело к созданию линейного предсказательного кодирования (LPC) и кепстральных коэффициентов LPC.
В 1980 году Стивен Дэвис и Пол Мермельштейн из Bell Labs предложили использовать мел-шкалу, основанную на психоакустических исследованиях, для взвешивания спектральных энергий перед кепстральным преобразованием. Это позволило создать признаки, более устойчивые к вариациям речи и шуму, чем традиционные кепстральные коэффициенты. С тех пор MFCC стали основой большинства систем распознавания речи, включая ранние коммерческие продукты, такие как Dragon NaturallySpeaking.
¶Принцип вычисления
Вычисление MFCC включает несколько этапов, преобразующих исходный звуковой сигнал в набор коэффициентов.
¶Предварительная обработка
Сигнал разбивается на короткие кадры (обычно 20–40 мс) с перекрытием (например, 10 мс). Каждый кадр умножается на оконную функцию (например, окно Хэмминга) для уменьшения спектральных утечек.
¶Быстрое преобразование Фурье (БПФ)
Для каждого кадра вычисляется спектр мощности с помощью БПФ. Получается набор амплитуд для различных частот.
¶Применение мел-фильтров
Спектральные энергии группируются по частотным полосам, соответствующим мел-шкале. Мел-шкала — это нелинейная шкала высоты звука, приближающая восприятие человеческого уха: она линейна для низких частот (до 1000 Гц) и логарифмична для высоких. Для преобразования частоты \( f \) в мелы используется формула: \[ m = 2595 \log_{10}\left(1 + \frac{f}{700}\right) \] Обычно применяется набор из 20–40 треугольных фильтров, равномерно расположенных на мел-шкале. Для каждого фильтра вычисляется логарифм суммы энергий в его полосе.
¶Логарифмирование
Логарифмирование амплитуд фильтров имитирует нелинейность громкостного восприятия (закон Вебера — Фехнера).
¶Дискретное косинусное преобразование (ДКП)
Логарифмированные энергии фильтров преобразуются с помощью ДКП. Это даёт набор коэффициентов, где первые несколько (обычно 12–13) содержат основную информацию о спектральной огибающей, а последние — высокочастотные детали, часто отбрасываемые как шум.
¶Дельта- и дельта-дельта коэффициенты
Для учёта динамики речи добавляются первые и вторые производные MFCC по времени (дельта- и дельта-дельта коэффициенты). Они вычисляются как разности между соседними кадрами, что позволяет моделировать изменения спектра во времени.
¶Характеристики
MFCC обладают рядом свойств, делающих их эффективными для речевых задач:
- Устойчивость к шуму: логарифмирование и ДКП снижают влияние аддитивного шума.
- Компактность: 12–20 коэффициентов заменяют сотни спектральных отсчётов.
- Инвариантность к высоте тона: мел-шкала и кепстральное преобразование отделяют спектральную огибающую (тембр) от гармонической структуры (высоты тона).
- Психологическая обоснованность: соответствие восприятию звука человеком.
Ограничения включают чувствительность к изменениям канала передачи (например, микрофона) и необходимость в достаточном количестве данных для обучения моделей.
¶Применение
¶Распознавание речи
MFCC являются основным признаком в большинстве систем ASR, включая скрытые марковские модели (HMM) и глубокие нейронные сети (DNN). Они используются в голосовых помощниках (например, «Алиса» от Яндекса, Siri от Apple), системах диктовки и автоматическом субтитровании.
¶Идентификация диктора
В системах верификации и идентификации диктора MFCC извлекаются из голосового слепка и сравниваются с эталонными шаблонами. Это применяется в биометрической аутентификации, криминалистике и системах доступа.
¶Анализ эмоций
MFCC используются для классификации эмоционального состояния по голосу, например, в системах психологического тестирования или оценки качества обслуживания.
¶Музыкальный анализ
В музыковедении MFCC применяются для классификации жанров, поиска похожих треков и анализа тембра инструментов.
¶Медицина
MFCC анализируются для диагностики заболеваний голосовых связок, болезни Паркинсона и других нарушений, влияющих на речь.
¶Варианты и модификации
Существуют модификации MFCC, адаптированные под конкретные задачи:
- PNCC (Power-Normalized Cepstral Coefficients) — улучшенная версия с нормализацией мощности, устойчивая к шуму.
- Gammatone Cepstral Coefficients (GTCC) — используют гамматоновые фильтры, имитирующие базилярную мембрану уха.
- Fbank (Filterbank energies) — логарифмированные энергии фильтров без ДКП, часто применяемые в нейронных сетях.
- LPC-MFCC — комбинация линейного предсказательного кодирования и мел-фильтрации.
¶Критика
Основные недостатки MFCC:
- Зависимость от акустической среды: шум, реверберация и искажения канала снижают точность.
- Потеря информации: ДКП отбрасывает корреляции между фильтрами, что может быть полезно для некоторых задач.
- Неоптимальность для глубоких нейронных сетей: современные системы ASR часто используют сырые спектрограммы или Fbank, так как нейросети могут самостоятельно извлекать признаки.
Тем не менее, MFCC остаются стандартом для сравнения и начальной обработки сигналов.
¶Интересные факты
- Название «кепстральный» происходит от перестановки букв в слове «спектральный» (spectral → cepstral), что отражает обратное преобразование.
- Количество MFCC обычно выбирается равным 12–13, так как это соответствует числу критических полос слуха в диапазоне речи.
- В системах распознавания речи на русском языке MFCC часто комбинируются с признаками, учитывающими особенности русской фонетики (например, палатализацию).
¶Источники
- Davis, S. B., & Mermelstein, P. (1980). Comparison of parametric representations for monosyllabic word recognition in continuously spoken sentences. IEEE Transactions on Acoustics, Speech, and Signal Processing, 28(4), 357–366.
- Rabiner, L. R., & Juang, B. H. (1993). Fundamentals of Speech Recognition. Prentice Hall.
- Huang, X., Acero, A., & Hon, H. W. (2001). Spoken Language Processing: A Guide to Theory, Algorithm, and System Development. Prentice Hall.
- Stevens, S. S., Volkmann, J., & Newman, E. B. (1937). A scale for the measurement of the psychological magnitude pitch. Journal of the Acoustical Society of America, 8(3), 185–190.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →

