Мел-частотные кепстральные коэффициенты
Мел-частотные кепстральные коэффициенты (MFCC, от англ. Mel-frequency cepstral coefficients) — это набор признаков, широко используемый в обработке речевых сигналов и распознавании речи. Они представляют собой компактное представление спектральной огибающей звукового сигнала, адаптированное к особенностям восприятия звука человеческим ухом. MFCC являются одним из наиболее распространённых типов акустических признаков в системах автоматического распознавания речи (ASR), идентификации диктора, анализа эмоций и музыки.
История
Разработка мел-частотных кепстральных коэффициентов связана с исследованиями в области психоакустики и цифровой обработки сигналов. В 1970-х годах учёные, в частности Стивен Дэвис и Пол Мермельштейн, предложили использовать мел-шкалу для приведения частотного анализа к человеческому восприятию. В 1980-х годах эта концепция была формализована в виде MFCC, которые стали стандартом в системах распознавания речи. Первоначально MFCC применялись в задачах фонетического анализа, но с развитием вычислительных мощностей и машинного обучения их использование расширилось на множество смежных областей.
Принцип работы
MFCC основаны на кепстральном анализе, который преобразует спектр сигнала в кепстр — представление, где оси частот заменены на «квефренси» (quefrency), амплитуды — на «гамнитуды» (gamnitude). Кепстр позволяет разделить спектральную огибающую (форму спектра) и мелкомасштабные детали (например, гармоники). В случае MFCC используется мел-шкала, которая линейна до 1000 Гц и логарифмична выше, имитируя нелинейное восприятие высоты тона человеком.
Основные этапы вычисления
- Предварительная обработка: сигнал разбивается на короткие кадры (обычно 20–40 мс) с перекрытием (например, 50%). Каждый кадр умножается на оконную функцию (например, Хэмминга) для уменьшения спектральных утечек.
- Быстрое преобразование Фурье (БПФ): для каждого кадра вычисляется спектр мощности.
- Мел-фильтрация: спектр пропускается через набор треугольных полосовых фильтров, равномерно расположенных на мел-шкале. Количество фильтров обычно составляет 20–40.
- Логарифмирование: выход каждого фильтра логарифмируется, что моделирует логарифмическую чувствительность слуха.
- Дискретное косинусное преобразование (ДКП): логарифмические энергии фильтров преобразуются в кепстральные коэффициенты. Обычно оставляют первые 12–13 коэффициентов, так как они содержат основную информацию о спектральной огибающей.
- Динамические признаки: к статическим MFCC добавляют их производные (дельта- и дельта-дельта-коэффициенты), отражающие изменения во времени.
Характеристики и параметры
Основные параметры, влияющие на качество MFCC:
- Количество фильтров: чем больше фильтров, тем выше разрешение, но избыточность может снизить устойчивость к шуму. Стандартное значение — 26.
- Количество коэффициентов: обычно 12–13 статических MFCC, плюс 12–13 дельта- и 12–13 дельта-дельта-коэффициентов, итого 36–39 признаков.
- Размер кадра: 25 мс — стандарт для речи, 40 мс — для музыки.
- Шаг кадра: 10 мс (перекрытие 60%).
- Мел-шкала: преобразование частоты f (в Гц) в мелы: m = 2595 × log10(1 + f/700).
Применение
Распознавание речи
MFCC являются основным типом признаков в большинстве систем ASR, включая скрытые марковские модели (HMM) и нейронные сети. Они позволяют эффективно различать фонемы, так как отражают форму спектральной огибающей, которая коррелирует с артикуляцией.
Идентификация и верификация диктора
MFCC используются для построения голосовых отпечатков (voiceprints), так как они устойчивы к вариациям тембра и интонации. Системы идентификации диктора сравнивают MFCC-векторы с эталонными моделями.
Анализ эмоций и аффективных состояний
MFCC применяются для классификации эмоциональных состояний (радость, гнев, грусть) по голосу, так как они чувствительны к изменениям в спектральной энергии и тональности.
Музыкальная информатика
В задачах классификации музыкальных жанров, инструментов и аккордов MFCC используются как компактное представление тембральных характеристик.
Медицинская диагностика
MFCC анализируют голосовые сигналы для выявления патологий голосовых связок, болезни Паркинсона и других расстройств, влияющих на речевую продукцию.
Преимущества и недостатки
Преимущества
- Компактность: MFCC сжимают спектральную информацию в небольшое число признаков.
- Устойчивость к шуму: логарифмирование и кепстральное преобразование уменьшают влияние аддитивного шума.
- Соответствие слуху: мел-шкала приближает анализ к человеческому восприятию.
- Инвариантность к высоте тона: MFCC фокусируются на спектральной огибающей, а не на гармониках.
Недостатки
- Чувствительность к каналу передачи: микрофон, акустика помещения и сжатие аудио могут искажать MFCC.
- Потеря фазовой информации: MFCC основаны на спектре мощности, игнорируя фазу, что может быть важно для некоторых задач.
- Необходимость нормализации: для сравнения разных записей требуется нормализация громкости и длительности.
Сравнение с другими признаками
MFCC часто сравнивают с линейными частотными кепстральными коэффициентами (LFCC), которые используют линейную шкалу частот, и с перцептивными линейными предсказаниями (PLP). LFCC лучше подходят для анализа высокочастотных компонентов, но хуже моделируют слух. PLP, разработанные Хермански, объединяют мел-шкалу, равную громкость и интенсивность, что даёт более психоакустически обоснованное представление, но требует больше вычислений.
Интересные факты
- MFCC были впервые предложены в 1980 году в статье «Comparison of parametric representations for monosyllabic word recognition in continuously spoken sentences» Стивена Дэвиса и Пола Мермельштейна.
- В системах распознавания речи MFCC часто используются в комбинации с энергетическими признаками (RMS) и нулевыми пересечениями.
- В современных нейросетевых подходах (например, wav2vec 2.0) MFCC иногда заменяются сырыми аудио-волнами, но остаются популярными для задач с ограниченными вычислительными ресурсами.
Источники
- Davis, S. B., & Mermelstein, P. (1980). Comparison of parametric representations for monosyllabic word recognition in continuously spoken sentences. IEEE Transactions on Acoustics, Speech, and Signal Processing.
- Huang, X., Acero, A., & Hon, H. W. (2001). Spoken Language Processing: A Guide to Theory, Algorithm, and System Development. Prentice Hall.
- Rabiner, L. R., & Juang, B. H. (1993). Fundamentals of Speech Recognition. Prentice Hall.
- Hermansky, H. (1990). Perceptual linear predictive (PLP) analysis of speech. Journal of the Acoustical Society of America.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →