Пространственная регрессия¶
Пространственная регрессия — это совокупность статистических методов, используемых для моделирования взаимосвязей между переменными с учётом пространственной зависимости (автокорреляции) данных. В отличие от классической регрессии, предполагающей независимость наблюдений, пространственная регрессия учитывает, что значения переменных в близко расположенных географических точках часто коррелируют между собой (например, уровень загрязнения воздуха в соседних районах города). Методы пространственной регрессии широко применяются в экономике, экологии, эпидемиологии, геологии, региональной науке и других областях, где данные имеют пространственную привязку.
¶Предпосылки и необходимость
Классическая линейная регрессия (МНК) основана на допущении, что остатки модели независимы и одинаково распределены. Однако для пространственных данных это допущение часто нарушается из-за пространственной автокорреляции — явления, при котором значения переменной в соседних точках более схожи, чем в удалённых (закон Тоблера: «всё связано со всем, но близкие вещи связаны сильнее, чем далёкие»). Игнорирование пространственной зависимости приводит к:
- смещённым оценкам коэффициентов регрессии;
- заниженным стандартным ошибкам;
- некорректным выводам о значимости факторов;
- потере эффективности модели.
Пространственная регрессия позволяет учесть эту зависимость, вводя в модель пространственные веса или лаги.
¶Основные модели
¶Модель пространственной авторегрессии (SAR)
Модель SAR (Spatial Autoregressive Model) учитывает влияние зависимой переменной в соседних точках на значение в данной точке. Уравнение имеет вид:
\[ y = \rho W y + X\beta + \varepsilon \]
где:
- \(y\) — вектор зависимой переменной;
- \(\rho\) — коэффициент пространственной автокорреляции (параметр пространственного лага);
- \(W\) — матрица пространственных весов (определяет соседство);
- \(X\) — матрица независимых переменных;
- \(\beta\) — вектор коэффициентов регрессии;
- \(\varepsilon\) — вектор случайных ошибок.
Модель SAR интерпретируется как: значение \(y\) в точке зависит от взвешенной суммы значений \(y\) в соседних точках и от набора предикторов.
¶Модель пространственной ошибки (SEM)
Модель SEM (Spatial Error Model) предполагает, что пространственная автокорреляция присутствует не в самой зависимой переменной, а в ошибках регрессии:
\[ y = X\beta + u, \quad u = \lambda W u + \varepsilon \]
где \(\lambda\) — коэффициент пространственной автокорреляции ошибок. Эта модель используется, когда пространственная зависимость возникает из-за пропущенных переменных или измерительных ошибок, которые коррелируют в пространстве.
¶Модель пространственного лага (SLX)
Модель SLX (Spatial Lag of X) включает пространственные лаги независимых переменных:
\[ y = X\beta + W X \theta + \varepsilon \]
где \(\theta\) — вектор коэффициентов для пространственных лагов предикторов. Эта модель проще в интерпретации, так как не требует оценки параметров пространственной зависимости.
¶Модель пространственного Дарбина (SDM)
Модель SDM (Spatial Durbin Model) объединяет SAR и SLX, включая как пространственный лаг зависимой переменной, так и пространственные лаги независимых:
\[ y = \rho W y + X\beta + W X \theta + \varepsilon \]
SDM позволяет оценивать как прямые эффекты (влияние предикторов в данной точке), так и косвенные (влияние предикторов в соседних точках).
¶Модель пространственной автокорреляции (SAC)
Модель SAC (Spatial Autoregressive Combined) включает и пространственный лаг зависимой переменной, и пространственную автокорреляцию ошибок:
\[ y = \rho W y + X\beta + u, \quad u = \lambda W u + \varepsilon \]
Это наиболее общая спецификация, но она может быть сложна в оценке из-за идентификации параметров.
¶Матрица пространственных весов
Ключевым элементом пространственной регрессии является матрица весов \(W\), которая определяет, какие наблюдения считаются «соседями» и какова сила их влияния. Матрица строится на основе пространственного расположения точек (центроиды полигонов, координаты точек) и может быть:
- по смежности (contiguity): соседи — полигоны, имеющие общую границу (например, районы города);
- по расстоянию (distance-based): соседи — точки в пределах заданного радиуса или k-ближайших соседей;
- по обратному расстоянию (inverse distance): вес обратно пропорционален расстоянию между точками.
Матрица обычно нормируется по строкам (row-standardized), чтобы сумма весов каждой строки равнялась 1, что упрощает интерпретацию.
¶Оценка параметров
Из-за наличия пространственного лага (\(W y\)) стандартный метод наименьших квадратов (МНК) даёт смещённые оценки для SAR, SDM и SAC. Для оценки параметров используются:
- Метод максимального правдоподобия (ML) — наиболее распространённый, основан на предположении о нормальном распределении ошибок;
- Обобщённый метод моментов (GMM) — не требует нормальности, устойчив к гетероскедастичности;
- Двухшаговый метод наименьших квадратов (2SLS) — использует инструментальные переменные.
Для SEM и SLX МНК может давать состоятельные, но неэффективные оценки, поэтому также применяют ML или GMM.
¶Тестирование пространственной зависимости
Перед построением пространственной регрессии необходимо проверить наличие пространственной автокорреляции. Основные тесты:
- Индекс Морана (I) — глобальный тест на пространственную автокорреляцию остатков МНК;
- Тест множителей Лагранжа (LM) — для выбора между SAR и SEM (LM-lag и LM-error);
- Робастные версии LM-тестов — для уточнения спецификации модели.
¶Применение
¶Экономика и региональная наука
- Моделирование цен на жильё (гедонические модели с учётом соседства);
- Анализ регионального экономического роста (влияние соседних регионов);
- Оценка эффектов пространственного распространения инноваций.
¶Экология и география
- Моделирование распространения загрязнителей (например, концентрация PM2.5);
- Прогнозирование распространения видов растений или животных;
- Анализ климатических данных.
¶Эпидемиология
- Моделирование заболеваемости (например, COVID-19 с учётом соседства регионов);
- Оценка распространения инфекций в пространстве.
¶Геология и горное дело
- Оценка запасов полезных ископаемых (кригинг с пространственной регрессией);
- Моделирование свойств горных пород.
¶Пример
Рассмотрим влияние уровня доходов и плотности населения на цены на жильё в городе. Классическая регрессия может показать, что в районах с высокими доходами цены выше. Однако если в соседнем районе также высокие цены (из-за престижности), то модель SAR выявит пространственный лаг: цена в данном районе зависит не только от его характеристик, но и от цен в соседних районах. Это позволяет точнее оценить эффект доходов и избежать смещения.
¶Ограничения и критика
- Выбор матрицы весов — субъективен и может существенно влиять на результаты; нет единого стандарта.
- Интерпретация коэффициентов — в моделях с пространственным лагом (SAR, SDM) прямые и косвенные эффекты различаются, что усложняет анализ.
- Размер данных — оценка ML требует больших вычислительных ресурсов при большом числе наблюдений (более 10 000).
- Эндогенность — пространственный лаг является эндогенной переменной, что требует инструментов.
- Предположение о стационарности — пространственная регрессия часто предполагает, что пространственные процессы однородны, что не всегда верно.
¶Программное обеспечение
Пространственная регрессия реализована в ряде статистических пакетов:
- R: пакеты
spdep,spatialreg,sphet,splm; - Python: библиотеки
pysal,spreg,geopandas; - Stata: команды
spreg,spatreg,spivreg; - GeoDa: бесплатное приложение с графическим интерфейсом для пространственного анализа.
¶Источники
- Anselin L. Spatial Econometrics: Methods and Models. — Springer, 1988.
- LeSage J., Pace R. K. Introduction to Spatial Econometrics. — CRC Press, 2009.
- Bivand R., Pebesma E., Gómez-Rubio V. Applied Spatial Data Analysis with R. — Springer, 2013.
- Arbia G. A Primer for Spatial Econometrics. — Palgrave Macmillan, 2014.