Открыть сервис

Спектрограмма

Спектрограмма — это графическое представление спектральной плотности мощности или амплитуды сигнала (обычно звукового) в зависимости от времени. В отличие от осциллограммы, показывающей изменение амплитуды сигнала во времени, или спектра, показывающего распределение энергии по частотам в фиксированный момент, спектрограмма объединяет обе эти оси: по горизонтальной оси откладывается время, по вертикальной — частота, а интенсивность цвета или яркость точки в каждой координате (время, частота) отражает амплитуду (громкость) сигнала на данной частоте в данный момент времени. Спектрограммы широко используются в акустике, лингвистике, музыке, радиотехнике, сейсмологии и других областях для анализа нестационарных сигналов.

История

Первые попытки визуализировать звук были предприняты в XIX веке. В 1878 году американский изобретатель Эдисон создал фонограф, который мог записывать и воспроизводить звук, но не позволял его видеть. В 1940-х годах в лабораториях Bell Telephone Laboratories (США) для анализа речи и синтеза звука был разработан «видимый речевой аппарат» (Visible Speech Machine). Это устройство, созданное инженерами Ральфом Поттером, Джорджем Коппом и Гарри Грином, в реальном времени преобразовывало звуковой сигнал в спектрограмму на экране электронно-лучевой трубки. Первые спектрограммы были чёрно-белыми: интенсивность сигнала кодировалась степенью почернения.

С развитием цифровых технологий в 1960–1970-х годах спектрограммы стали вычисляться с помощью алгоритмов быстрого преобразования Фурье (БПФ). Это позволило перейти от аналоговых устройств к программным анализаторам, которые стали доступны на персональных компьютерах. В 1980-х годах появились первые коммерческие программы для спектрального анализа звука (например, SpectraPlus). В XXI веке спектрограммы стали стандартным инструментом в аудиоредакторах (Audacity, Adobe Audition, Steinberg SpectraLayers) и специализированных научных пакетах (Praat, MATLAB, Sonic Visualiser).

Метод построения

Спектрограмма строится на основе вычисления спектра сигнала в последовательных коротких временных отрезках (окнах). Основные этапы:

  1. Разбиение сигнала на фреймы. Исходный сигнал делится на перекрывающиеся сегменты фиксированной длины (обычно от 10 до 50 миллисекунд). Перекрытие (например, 50% или 75%) позволяет сгладить переходы между фреймами и повысить временное разрешение.
  2. Оконное взвешивание. Каждый фрейм умножается на оконную функцию (например, окно Ханна, Хэмминга или Блэкмана), чтобы уменьшить спектральные утечки (артефакты, возникающие из-за разрывов на границах фрейма).
  3. Вычисление спектра. Для каждого взвешенного фрейма применяется быстрое преобразование Фурье (БПФ), которое переводит сигнал из временной области в частотную. Результатом является массив комплексных чисел, модуль которых соответствует амплитуде, а аргумент — фазе.
  4. Формирование изображения. Амплитудные значения (обычно в децибелах) для каждого фрейма и каждой частоты отображаются в виде пикселей или точек на двумерной плоскости. Цвет или яркость каждой точки кодирует амплитуду.

Параметры спектрограммы

Качество и информативность спектрограммы зависят от выбора параметров:

  • Размер окна (N): определяет временное и частотное разрешение. Чем больше окно, тем выше частотное разрешение, но ниже временное (и наоборот). Это фундаментальное ограничение, известное как принцип неопределённости Габора.
  • Шаг (hop size): расстояние между началами соседних фреймов. Меньший шаг даёт более плавное изображение, но увеличивает вычислительную нагрузку.
  • Оконная функция: влияет на форму спектральных лепестков и уровень боковых лепестков.
  • Шкала частот: может быть линейной (для анализа гармонических сигналов) или логарифмической (для анализа звуков, воспринимаемых человеком, где важен относительный шаг частот).
  • Цветовая карта: оттенки серого, радужная (jet), тепловая (hot) или другие палитры. Выбор цветовой схемы может влиять на читаемость спектрограммы.

Виды спектрограмм

По типу представления

  1. Амплитудная спектрограмма (наиболее распространённая): отображает амплитуду (или мощность) сигнала. Цвет кодирует уровень громкости.
  2. Фазовая спектрограмма: отображает фазу сигнала. Используется реже, в основном для анализа фазовых искажений или в задачах синтеза.
  3. Спектрограмма с постоянной добротностью (CQT — Constant Q Transform): использует логарифмическую шкалу частот и переменное разрешение, что лучше соответствует слуховому восприятию человека. Часто применяется в музыковедении.
  4. Мел-спектрограмма: частоты преобразуются в мел-шкалу, которая аппроксимирует нелинейное восприятие высоты тона человеком. Широко используется в системах распознавания речи (например, в нейросетях).
  5. Спектрограмма на основе вейвлет-преобразования: вместо оконного БПФ используется вейвлет-преобразование, что даёт лучшее временное разрешение на высоких частотах и частотное — на низких.

По способу отображения

  • Двумерная (2D): классическое изображение, где оси — время и частота, а цвет — амплитуда.
  • Трёхмерная (3D): добавляется ось амплитуды, создавая рельефную поверхность. Используется для наглядной демонстрации, но менее информативна для количественного анализа.

Применение

Лингвистика и фонетика

Спектрограммы являются основным инструментом для анализа речи. Они позволяют визуализировать форманты (частотные области концентрации энергии, характерные для гласных), переходные процессы (например, при произнесении согласных), а также интонацию и ударение. В программе Praat, созданной в Амстердамском университете, спектрограммы используются для автоматического распознавания фонем и изучения диалектов.

Музыка и звукорежиссура

  • Анализ тембра: спектрограмма показывает гармонический состав звука, что позволяет различать инструменты (например, скрипку и флейту).
  • Реставрация аудио: удаление щелчков, шумов и тресков, которые видны на спектрограмме как яркие вертикальные или горизонтальные полосы.
  • Мастеринг: контроль частотного баланса, выявление резонансов и паразитных частот.
  • Спектральное редактирование: в программах типа SpectraLayers можно «вырезать» или «перемещать» отдельные звуки на спектрограмме, например, удалить шум поезда из записи.

Медицина

  • Анализ сердечных тонов: спектрограммы фонокардиограмм помогают диагностировать шумы в сердце.
  • Анализ голосовых связок: спектрограммы голоса используются для выявления патологий (например, узелков на связках).
  • Электроэнцефалография (ЭЭГ): спектрограммы мозговых волн (альфа-, бета-, тета-ритмов) применяются в неврологии и психофизиологии.

Сейсмология и геофизика

Спектрограммы сейсмических сигналов позволяют выделять волны разных типов (P-волны, S-волны), определять время их прихода и оценивать магнитуду землетрясения. В сейсморазведке спектрограммы используются для анализа отражённых волн от подземных слоёв.

Радиотехника и связь

  • Спектральный анализ радиосигналов: спектрограммы помогают идентифицировать типы модуляции (AM, FM, QAM), выявлять помехи и перехватывать сигналы.
  • Software Defined Radio (SDR): в программах типа SDR# или GQRX спектрограммы отображаются в реальном времени, позволяя оператору видеть всю полосу частот.

Биоакустика

Спектрограммы используются для изучения звуков животных — пения птиц, криков китов, ультразвуковых сигналов летучих мышей. Это позволяет идентифицировать виды, изучать их поведение и миграции.

Интересные факты

  • В 1940-х годах спектрограммы использовались для обучения глухих детей чтению по губам и артикуляции. Проект «Visible Speech» в Bell Labs показал, что глухие могут научиться «видеть» звуки.
  • Спектрограммы применяются в криминалистике для идентификации голоса (судебная фонетика). Сравнение спектрограмм двух записей может служить доказательством в суде.
  • В музыке существует понятие «спектрограммного искусства» — создания изображений на основе спектрограмм. Например, группа «Aphex Twin» в 1999 году включила в свой трек «Equation» спектрограмму, изображающую лицо человека.
  • В 2017 году исследователи из Массачусетского технологического института (MIT) разработали алгоритм, который может восстанавливать звук по спектрограмме, полученной с вибраций объектов (например, по видеозаписи пакета с чипсами).

Критика и ограничения

  • Принцип неопределённости: невозможно одновременно получить высокое разрешение по времени и по частоте. Выбор параметров спектрограммы всегда является компромиссом.
  • Артефакты: оконные функции и перекрытие фреймов могут создавать ложные частотные компоненты (спектральные утечки) или размывать изображение.
  • Субъективность интерпретации: анализ спектрограммы требует опыта, особенно в лингвистике и музыке, где границы между формантами или гармониками могут быть нечёткими.
  • Вычислительная сложность: для длинных сигналов (например, часовых записей) построение спектрограммы с высоким разрешением может требовать значительных ресурсов.

Источники

  • Oppenheim, A. V., Schafer, R. W. (1989). Discrete-Time Signal Processing. Prentice Hall.
  • Potter, R. K., Kopp, G. A., Green, H. C. (1947). Visible Speech. D. Van Nostrand Company.
  • Boersma, P., Weenink, D. (2023). Praat: doing phonetics by computer (программное обеспечение и документация).
  • Hainsworth, S. (2003). Techniques for the Automated Analysis of Musical Audio. PhD thesis, University of Cambridge.
  • «Spectrogram». Encyclopedia of Acoustics. Wiley, 1997.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →