Открыть сервис

Анализ временных рядов

Анализ временных рядов — это совокупность статистических методов и математических моделей, предназначенных для выявления структуры, описания, прогнозирования и управления процессами, представленными в виде последовательности наблюдений, упорядоченных во времени. В отличие от анализа случайных выборок, временные ряды обладают внутренней зависимостью между соседними наблюдениями (автокорреляцией), что требует специальных подходов для корректной обработки и интерпретации данных. Область применения простирается от экономики и финансов до метеорологии, сейсмологии, промышленного контроля и цифровой обработки сигналов.

Основные компоненты временного ряда

В классическом подходе временной ряд \( Y_t \) рассматривается как сумма (или произведение) нескольких ненаблюдаемых составляющих:

  • Тренд (T) — долгосрочная тенденция изменения ряда, отражающая устойчивое направление развития (рост, падение или стагнация). Может быть линейным, полиномиальным или описываться более сложными функциями.
  • Сезонная компонента (S) — периодические колебания с фиксированным и известным периодом (например, год, квартал, месяц, день недели). Повторяемость обусловлена природными, календарными или социальными факторами.
  • Циклическая компонента (C) — колебания с нефиксированным периодом, обычно связанные с экономическими циклами (например, циклы Кондратьева, деловые циклы). Длительность и амплитуда могут варьироваться.
  • Случайная (остаточная) компонента (ε) — нерегулярные, стохастические флуктуации, которые не могут быть объяснены трендом, сезонностью или цикличностью. Предполагается, что она является «белым шумом» — последовательностью независимых, одинаково распределённых случайных величин с нулевым математическим ожиданием.

В зависимости от характера взаимодействия компонент различают аддитивную модель (\( Y_t = T_t + S_t + C_t + \varepsilon_t \)) и мультипликативную модель (\( Y_t = T_t \cdot S_t \cdot C_t \cdot \varepsilon_t \)). Выбор модели определяется тем, зависит ли амплитуда сезонных колебаний от уровня тренда.

Стационарность и её виды

Ключевое понятие в анализе временных рядов — стационарность. Стационарным называется ряд, вероятностные характеристики которого (математическое ожидание, дисперсия, автоковариация) не зависят от времени. Различают два основных типа:

  • Строгая стационарность — совместное распределение любого набора наблюдений не меняется при сдвиге во времени. На практике редко выполняется.
  • Слабая стационарность (стационарность в широком смысле) — постоянство среднего значения, дисперсии и автоковариации, зависящей только от лага (разности во времени). Большинство моделей, таких как ARIMA, требуют именно слабой стационарности.

Нестационарные ряды (с трендом, сезонностью или изменяющейся дисперсией) перед моделированием обычно приводят к стационарному виду с помощью преобразований: взятие разностей (дифференцирование), логарифмирование, выделение тренда или сезонной составляющей. Для проверки стационарности используются статистические тесты: расширенный тест Дики — Фуллера (ADF), тест Филлипса — Перрона, тест Квятковского — Филлипса — Шмидта — Шина (KPSS).

Методы анализа

Классические методы

  • Скользящее среднее — простейший способ сглаживания ряда для выделения тренда. Вычисляется среднее арифметическое по окну фиксированной длины. Недостаток — потеря данных на краях ряда и запаздывание.
  • Экспоненциальное сглаживание — взвешенное среднее, где веса убывают экспоненциально по мере удаления от текущего момента. Позволяет адаптироваться к изменениям тренда. Модели Хольта (для тренда) и Хольта — Уинтерса (для тренда и сезонности) являются его обобщениями.
  • Декомпозиция — разложение ряда на тренд, сезонность и остаток. Классическая декомпозиция (аддитивная или мультипликативная) предполагает, что сезонная компонента постоянна во времени. Более современные методы, такие как STL (Seasonal-Trend decomposition using LOESS), позволяют сезонной компоненте изменяться.

Модели авторегрессии и скользящего среднего

  • AR(p) — авторегрессионная модель порядка p: текущее значение ряда линейно зависит от p предыдущих значений и случайной ошибки. \( Y_t = c + \phi_1 Y_{t-1} + \phi_2 Y_{t-2} + \dots + \phi_p Y_{t-p} + \varepsilon_t \).
  • MA(q) — модель скользящего среднего порядка q: текущее значение зависит от q предыдущих значений ошибок. \( Y_t = \mu + \varepsilon_t + \theta_1 \varepsilon_{t-1} + \dots + \theta_q \varepsilon_{t-q} \).
  • ARMA(p, q)объединение AR и MA. Применяется к стационарным рядам.
  • ARIMA(p, d, q) — обобщение ARMA для нестационарных рядов. Параметр d указывает порядок дифференцирования (сколько раз нужно взять разность, чтобы ряд стал стационарным). Модель была популяризирована Джорджем Боксом и Гвилимом Дженкинсом в 1970-х годах (методология Бокса — Дженкинса).
  • SARIMA(p, d, q)(P, D, Q, s) — сезонная ARIMA, учитывающая сезонные колебания с периодом s. Включает сезонные авторегрессию, дифференцирование и скользящее среднее.

Спектральный анализ

Временной ряд может быть представлен как сумма синусоидальных и косинусоидальных колебаний различных частот. Спектральная плотность мощности (периодограмма) показывает, какой вклад в дисперсию ряда вносят колебания каждой частоты. Метод особенно полезен для выявления скрытых периодичностей, анализа волновых процессов и фильтрации сигналов.

Современные методы

  • Модели условной гетероскедастичности (ARCH, GARCH) — применяются для моделирования временных рядов с изменяющейся во времени дисперсией (например, финансовые доходности). Позволяют прогнозировать волатильность.
  • Нейросетевые моделирекуррентные нейронные сети (RNN, LSTM, GRU) и трансформеры (например, Time Series Transformer) способны улавливать сложные нелинейные зависимости и долгосрочные паттерны. Требуют больших объёмов данных и вычислительных ресурсов.
  • Методы машинного обученияградиентный бустинг (XGBoost, LightGBM, CatBoost), случайный лес, метод опорных векторов (SVR) часто используются для прогнозирования временных рядов с экзогенными факторами.
  • Модели пространства состояний и фильтр Калмана — позволяют оценивать ненаблюдаемые компоненты ряда (тренд, сезонность) в реальном времени, обновляя оценки по мере поступления новых данных.

Применение

Экономика и финансы

  • Прогнозирование макроэкономических показателей (ВВП, инфляция, безработица).
  • Анализ и прогноз цен на акции, облигации, валютные курсы.
  • Оценка риска и волатильности (VaR, GARCH-модели).
  • Изучение деловых циклов и долгосрочных трендов.

Промышленность и инженерия

  • Контроль качества продукции (анализ контрольных карт Шухарта).
  • Мониторинг и прогнозирование отказов оборудования (predictive maintenance).
  • Обработка сигналов в системах управления (вибрация, температура, давление).

Метеорология и климатология

  • Прогноз погоды (температура, осадки, давление).
  • Анализ климатических изменений (глобальное потепление, ледниковые периоды).
  • Моделирование гидрологических рядов (уровень воды в реках, сток).

Медицина и биология

  • Анализ электроэнцефалограмм (ЭЭГ) и электрокардиограмм (ЭКГ).
  • Моделирование распространения инфекционных заболеваний (эпидемиологические ряды).
  • Изучение биоритмов и физиологических циклов.

Цифровая обработка сигналов

  • Сжатие и кодирование аудио- и видеоданных.
  • Распознавание речи и обнаружение событий.
  • Фильтрация шумов и восстановление сигналов.

Инструменты и программное обеспечение

Для анализа временных рядов разработано множество библиотек и пакетов:

  • Python: statsmodels (ARIMA, VAR, декомпозиция), scikit-learn (машинное обучение), TensorFlow/Keras, PyTorch (нейросети), pmdarima (автоматический подбор ARIMA), Prophet (разработан Facebook, организация Meta признана экстремистской и запрещена в РФ).
  • R: forecast (ARIMA, ETS, нейросети), tseries, xts, zoo, fable.
  • MATLAB: Econometrics Toolbox, Signal Processing Toolbox.
  • Специализированные системы: EViews, Stata, Gretl, SAS.

Критика и ограничения

  • Нестационарность и структурные сдвиги — реальные ряды часто содержат разрывы, вызванные кризисами, реформами или технологическими изменениями, что нарушает предположения классических моделей.
  • Проблема прогнозирования — точность прогнозов резко снижается с увеличением горизонта прогнозирования. Долгосрочные прогнозы (более 1–2 периодов) часто имеют высокую неопределённость.
  • Переобучение — сложные модели (нейросети, ARIMA с большим числом параметров) могут подстраиваться под шум, а не под сигнал, что ухудшает обобщающую способность.
  • Экзогенные факторы — многие модели не учитывают влияние внешних переменных (политические события, природные катастрофы), что может приводить к систематическим ошибкам.
  • Требования к данным — для корректной оценки параметров требуется достаточно длинная история наблюдений (обычно не менее 50–100 точек). Редкие или нерегулярные ряды плохо поддаются анализу.

Источники

  • Бокс Дж., Дженкинс Г. Анализ временных рядов: прогноз и управление. — М.: Мир, 1974.
  • Кендалл М., Стьюарт А. Многомерный статистический анализ и временные ряды. — М.: Наука, 1976.
  • Лукашин Ю. П. Адаптивные методы краткосрочного прогнозирования временных рядов. — М.: Финансы и статистика, 2003.
  • Айвазян С. А., Мхитарян В. С. Прикладная статистика и основы эконометрики. — М.: ЮНИТИ, 1998.
  • Hyndman R. J., Athanasopoulos G. Forecasting: Principles and Practice. — 3rd ed. — OTexts, 2021.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →