Открыть сервис

Мел-частотные кепстральные коэффициенты

Мел-частотные кепстральные коэффициенты (MFCC, от англ. Mel-frequency cepstral coefficients) — это набор признаков, широко используемый в обработке речевых сигналов и распознавании речи. Они представляют собой компактное представление спектральной огибающей звукового сигнала, адаптированное к особенностям восприятия звука человеческим ухом. MFCC являются одним из наиболее распространённых типов акустических признаков в системах автоматического распознавания речи (ASR), идентификации диктора, анализа эмоций и музыки.

История

Разработка мел-частотных кепстральных коэффициентов связана с исследованиями в области психоакустики и цифровой обработки сигналов. В 1970-х годах учёные, в частности Стивен Дэвис и Пол Мермельштейн, предложили использовать мел-шкалу для приведения частотного анализа к человеческому восприятию. В 1980-х годах эта концепция была формализована в виде MFCC, которые стали стандартом в системах распознавания речи. Первоначально MFCC применялись в задачах фонетического анализа, но с развитием вычислительных мощностей и машинного обучения их использование расширилось на множество смежных областей.

Принцип работы

MFCC основаны на кепстральном анализе, который преобразует спектр сигнала в кепстр — представление, где оси частот заменены на «квефренси» (quefrency), амплитуды — на «гамнитуды» (gamnitude). Кепстр позволяет разделить спектральную огибающую (форму спектра) и мелкомасштабные детали (например, гармоники). В случае MFCC используется мел-шкала, которая линейна до 1000 Гц и логарифмична выше, имитируя нелинейное восприятие высоты тона человеком.

Основные этапы вычисления

  1. Предварительная обработка: сигнал разбивается на короткие кадры (обычно 20–40 мс) с перекрытием (например, 50%). Каждый кадр умножается на оконную функцию (например, Хэмминга) для уменьшения спектральных утечек.
  2. Быстрое преобразование Фурье (БПФ): для каждого кадра вычисляется спектр мощности.
  3. Мел-фильтрация: спектр пропускается через набор треугольных полосовых фильтров, равномерно расположенных на мел-шкале. Количество фильтров обычно составляет 20–40.
  4. Логарифмирование: выход каждого фильтра логарифмируется, что моделирует логарифмическую чувствительность слуха.
  5. Дискретное косинусное преобразование (ДКП): логарифмические энергии фильтров преобразуются в кепстральные коэффициенты. Обычно оставляют первые 12–13 коэффициентов, так как они содержат основную информацию о спектральной огибающей.
  6. Динамические признаки: к статическим MFCC добавляют их производные (дельта- и дельта-дельта-коэффициенты), отражающие изменения во времени.

Характеристики и параметры

Основные параметры, влияющие на качество MFCC:

  • Количество фильтров: чем больше фильтров, тем выше разрешение, но избыточность может снизить устойчивость к шуму. Стандартное значение — 26.
  • Количество коэффициентов: обычно 12–13 статических MFCC, плюс 12–13 дельта- и 12–13 дельта-дельта-коэффициентов, итого 36–39 признаков.
  • Размер кадра: 25 мс — стандарт для речи, 40 мс — для музыки.
  • Шаг кадра: 10 мс (перекрытие 60%).
  • Мел-шкала: преобразование частоты f (в Гц) в мелы: m = 2595 × log10(1 + f/700).

Применение

Распознавание речи

MFCC являются основным типом признаков в большинстве систем ASR, включая скрытые марковские модели (HMM) и нейронные сети. Они позволяют эффективно различать фонемы, так как отражают форму спектральной огибающей, которая коррелирует с артикуляцией.

Идентификация и верификация диктора

MFCC используются для построения голосовых отпечатков (voiceprints), так как они устойчивы к вариациям тембра и интонации. Системы идентификации диктора сравнивают MFCC-векторы с эталонными моделями.

Анализ эмоций и аффективных состояний

MFCC применяются для классификации эмоциональных состояний (радость, гнев, грусть) по голосу, так как они чувствительны к изменениям в спектральной энергии и тональности.

Музыкальная информатика

В задачах классификации музыкальных жанров, инструментов и аккордов MFCC используются как компактное представление тембральных характеристик.

Медицинская диагностика

MFCC анализируют голосовые сигналы для выявления патологий голосовых связок, болезни Паркинсона и других расстройств, влияющих на речевую продукцию.

Преимущества и недостатки

Преимущества

  • Компактность: MFCC сжимают спектральную информацию в небольшое число признаков.
  • Устойчивость к шуму: логарифмирование и кепстральное преобразование уменьшают влияние аддитивного шума.
  • Соответствие слуху: мел-шкала приближает анализ к человеческому восприятию.
  • Инвариантность к высоте тона: MFCC фокусируются на спектральной огибающей, а не на гармониках.

Недостатки

  • Чувствительность к каналу передачи: микрофон, акустика помещения и сжатие аудио могут искажать MFCC.
  • Потеря фазовой информации: MFCC основаны на спектре мощности, игнорируя фазу, что может быть важно для некоторых задач.
  • Необходимость нормализации: для сравнения разных записей требуется нормализация громкости и длительности.

Сравнение с другими признаками

MFCC часто сравнивают с линейными частотными кепстральными коэффициентами (LFCC), которые используют линейную шкалу частот, и с перцептивными линейными предсказаниями (PLP). LFCC лучше подходят для анализа высокочастотных компонентов, но хуже моделируют слух. PLP, разработанные Хермански, объединяют мел-шкалу, равную громкость и интенсивность, что даёт более психоакустически обоснованное представление, но требует больше вычислений.

Интересные факты

  • MFCC были впервые предложены в 1980 году в статье «Comparison of parametric representations for monosyllabic word recognition in continuously spoken sentences» Стивена Дэвиса и Пола Мермельштейна.
  • В системах распознавания речи MFCC часто используются в комбинации с энергетическими признаками (RMS) и нулевыми пересечениями.
  • В современных нейросетевых подходах (например, wav2vec 2.0) MFCC иногда заменяются сырыми аудио-волнами, но остаются популярными для задач с ограниченными вычислительными ресурсами.

Источники

  • Davis, S. B., & Mermelstein, P. (1980). Comparison of parametric representations for monosyllabic word recognition in continuously spoken sentences. IEEE Transactions on Acoustics, Speech, and Signal Processing.
  • Huang, X., Acero, A., & Hon, H. W. (2001). Spoken Language Processing: A Guide to Theory, Algorithm, and System Development. Prentice Hall.
  • Rabiner, L. R., & Juang, B. H. (1993). Fundamentals of Speech Recognition. Prentice Hall.
  • Hermansky, H. (1990). Perceptual linear predictive (PLP) analysis of speech. Journal of the Acoustical Society of America.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →