Открыть сервис

Психоакустическое моделирование

Психоакустическое моделирование — это раздел цифровой обработки сигналов и акустики, изучающий и использующий математические модели слухового восприятия человека для оптимизации обработки, передачи и воспроизведения звука. Основная цель моделирования — удаление или перераспределение акустической информации, неразличимой для человеческого уха, для снижения битрейта или улучшения субъективного качества звучания.

Физиологические основы

Моделирование опирается на особенности работы слуховой системы — от улитки внутреннего уха до слуховой коры головного мозга. Ключевые механизмы:

  • Частотная избирательность: базилярная мембрана улитки разлагает звук на частотные компоненты, а набор внутренних волосковых клеток формирует частотно-пространственную карту. Эта избирательность описывается через критические полосы — полосы частот, в пределах которых маскирующий тон подавляет сигнал как единое целое.
  • Маскирование: явление, при котором один звук (маскер) снижает или полностью скрывает восприятие другого (маскируемого). Различают частотное (одновременное) маскирование, когда маскер и сигнал звучат одновременно, и временное маскирование, когда сигнал не слышен до или после маскера (пред- и постмаскирование).
  • Порог слышимости: абсолютный минимальный уровень звукового давления, при котором звук данной частоты воспринимается в тишине. Форма порога зависит от возраста и индивидуальных особенностей слуха.

Методы и алгоритмы

Модели критических полос

В основе большинства психоакустических моделей лежит преобразование частотной оси в шкалу Барка или шкалу ERB (эквивалентная прямоугольная полоса). Шкала Барка делит диапазон слышимых частот (примерно 20 Гц — 20 кГц) на 24 критические полосы. Для каждой полосы вычисляется уровень маскирования, который зависит от громкости и частоты маскера.

Вычисление порога маскирования

Алгоритм включает следующие этапы:

  1. Разбиение сигнала на короткие кадры (обычно 1024 или 2048 отсчётов) с перекрытием.
  2. Выполнение быстрого преобразования Фурье (БПФ) для получения спектра мощности.
  3. Разложение спектра на тональные и шумовые компоненты (детектирование тональности).
  4. Расчёт индивидуальных порогов маскирования для каждой критической полосы с учётом коэффициентов расширения полосы.
  5. Суммирование порогов и сравнение с абсолютным порогом слышимости.
  6. Определение глобального порога маскирования — уровня, ниже которого все компоненты сигнала неразличимы.

Модель громкости

Дополнительно применяется модель громкости по Цвикеру (specific loudness), которая учитывает нелинейность восприятия громкости в зависимости от уровня и частоты. Это позволяет оценить, какие изменения сигнала будут субъективно незаметны.

Применение

Сжатие звука с потерями

Наиболее массовое применение — в аудиокодеках: MP3 (MPEG-1 Layer III), AAC (Advanced Audio Coding), Opus, Vorbis и др. Психоакустическая модель используется в кодировщике для определения, какие частотные компоненты можно заквантовать грубее или отбросить без слышимых искажений. Битрейт при этом снижается в 10–12 раз по сравнению с несжатым PCM-звуком при субъективно близком качестве.

Шумоподавление и реставрация

В системах шумоподавления модель слуха позволяет отличать полезный сигнал от шума, ориентируясь на пороги маскирования. В реставрации старых записей психоакустические алгоритмы маскируют дефекты (щелчки, треск) под естественными компонентами сигнала.

Пространственный звук и 3D-аудио

При синтезе бинаурального звука и виртуального окружения моделирование учитывает HRTF (передаточные функции головы) и эффекты маскирования для создания иллюзии расположения источника звука в пространстве.

Слуховые протезы и аудиометрия

В слуховых аппаратах психоакустические модели применяются для частотной компрессии — переноса высокочастотной информации в область сохранного слуха, а также для адаптивного подавления обратной связи.

Ограничения и критика

  • Индивидуальность слуха: модели построены на усреднённых данных; реальные пороги маскирования у разных людей могут отличаться на 10–15 дБ.
  • Нестационарные сигналы: большинство моделей плохо работают с резкими переходными процессами (атаки ударных, хлопки), что приводит к характерным артефактам — «преэхо» в кодеках.
  • Взаимодействие с громкостью: при прослушивании на высокой громкости пороги маскирования меняются, и модель, настроенная на средний уровень, может допускать слышимые искажения.
  • Сложность и вычислительные затраты: точные модели требуют значительных ресурсов, что ограничивает их применение в системах реального времени с низким энергопотреблением.

Литература

  • Звикер Э., Фельдкеллер Р. «Ухо как приемник информации». — М.: Связь, 1971.
  • Fastl H., Zwicker E. «Psychoacoustics: Facts and Models». — Springer, 2007.
  • Painter T., Spanias A. «Perceptual Coding of Digital Audio» // Proceedings of the IEEE, 2000.
  • ITU-R BS.1387 — метод объективной оценки качества звука PEAQ.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →