Пространственная автокорреляция¶
Пространственная автокорреляция — это статистическая мера, описывающая степень зависимости значений переменной в пространстве от значений той же переменной в соседних или близлежащих точках. В отличие от классической (временной) автокорреляции, где зависимость рассматривается во времени, пространственная автокорреляция учитывает географическое расположение данных. Основной принцип, лежащий в основе этого понятия, известен как первый закон географии Уолдо Тоблера: «Всё связано со всем, но близкие вещи связаны сильнее, чем далёкие». Пространственная автокорреляция является фундаментальным инструментом в пространственном анализе, геостатистике, экологии, эпидемиологии, экономике и других областях, где данные имеют пространственную привязку.
¶Основные понятия
¶Пространственная структура данных
Пространственная автокорреляция возникает, когда значения переменной не распределены случайным образом по территории, а образуют кластеры (сгущения) или, наоборот, дисперсные (разреженные) паттерны. Для её измерения необходимо определить, какие объекты считаются соседними. Это задаётся с помощью матрицы пространственных весов (W), которая описывает топологию связей между точками или полигонами. Элементы матрицы \( w_{ij} \) обычно равны 1, если объекты \( i \) и \( j \) являются соседями (например, имеют общую границу или находятся в пределах заданного расстояния), и 0 в противном случае. Часто веса нормируются по строкам (row-standardization), чтобы сумма весов для каждого объекта равнялась 1.
¶Типы пространственной автокорреляции
Различают два основных типа:
- Положительная пространственная автокорреляция: соседние объекты имеют схожие значения (высокие рядом с высокими, низкие рядом с низкими). Это характерно для кластеризованных данных, например, концентрация загрязнителей в промышленной зоне.
- Отрицательная пространственная автокорреляция: соседние объекты имеют противоположные значения (высокие рядом с низкими). Это наблюдается, например, при конкуренции видов в экологии, когда особи одного вида стремятся избегать друг друга.
Если значения распределены случайно, пространственная автокорреляция отсутствует.
¶История и развитие
Идея учёта пространственной зависимости восходит к работам английского статистика Рональда Фишера (1920-е годы) и географа Уолдо Тоблера (1970), сформулировавшего свой закон. Однако систематический математический аппарат был разработан в 1950–1970-х годах. Ключевой вклад внёс австралийский статистик Патрик Моран, который в 1950 году предложил I-статистику Морана — первый глобальный индикатор пространственной автокорреляции. Позже, в 1970-х, британский географ Кит О’Салливан и другие исследователи разработали локальные индикаторы (LISA), позволяющие выявлять кластеры на локальном уровне. В 1990-х годах с развитием географических информационных систем (ГИС) методы пространственной автокорреляции стали широко доступны для практического применения.
¶Методы измерения
¶Глобальные индикаторы
Глобальные индексы оценивают пространственную автокорреляцию для всего набора данных (всей территории). Основные из них:
- I-статистика Морана (Moran's I): наиболее распространённый показатель. Рассчитывается как:
\[ I = \frac{n}{\sum_{i=1}^{n} \sum_{j=1}^{n} w_{ij}} \cdot \frac{\sum_{i=1}^{n} \sum_{j=1}^{n} w_{ij} (x_i - \bar{x})(x_j - \bar{x})}{\sum_{i=1}^{n} (x_i - \bar{x})^2} \] где \( n \) — число объектов, \( x_i \) и \( x_j \) — значения переменной, \( \bar{x} \) — среднее, \( w_{ij} \) — элементы матрицы весов. Значения I варьируются от -1 (сильная отрицательная автокорреляция) до +1 (сильная положительная). Значение 0 указывает на случайное распределение. Статистическая значимость оценивается с помощью z-теста или перестановочного теста.
- C-статистика Гири (Geary's C): альтернативный показатель, более чувствительный к локальным вариациям. Рассчитывается как отношение суммы квадратов разностей между соседними значениями к дисперсии. Значения C от 0 (положительная автокорреляция) до 2 (отрицательная), причём 1 соответствует случайному распределению.
¶Локальные индикаторы (LISA)
Локальные индикаторы пространственной автокорреляции (Local Indicators of Spatial Association, LISA) позволяют выявить кластеры и выбросы на локальном уровне. Наиболее известен локальный I-индекс Морана (Local Moran's I), который для каждого объекта \( i \) рассчитывается как: \[ I_i = \frac{x_i - \bar{x}}{\sum_{k=1}^{n} (x_k - \bar{x})^2 / n} \cdot \sum_{j=1}^{n} w_{ij} (x_j - \bar{x}) \] Положительные значения \( I_i \) указывают на кластеры (высокие-высокие или низкие-низкие), отрицательные — на выбросы (высокие-низкие или низкие-высокие). Результаты визуализируются на картах кластеризации, где выделяются четыре типа: HH (high-high), HL (high-low), LH (low-high), LL (low-low).
¶Другие методы
- G-статистика Гетиса-Орда (Getis-Ord G): используется для выявления «горячих точек» (кластеров высоких значений) и «холодных точек» (кластеров низких значений). Различают глобальный G и локальный \( G_i^* \).
- Вариограмма (variogram): в геостатистике для моделирования пространственной зависимости используется вариограмма, которая показывает, как дисперсия разностей значений меняется с расстоянием.
¶Применение
¶Экология и биология
Пространственная автокорреляция используется для анализа распределения видов, оценки ареалов обитания, выявления кластеров заболеваемости растений или животных. Например, с её помощью можно определить, распространяется ли инвазивный вид случайно или образует очаги.
¶Эпидемиология
В эпидемиологии методы пространственной автокорреляции применяются для выявления кластеров заболеваний (например, рака, инфекционных болезней) и оценки факторов риска. Это позволяет выявить территории с повышенной заболеваемостью и направить ресурсы здравоохранения.
¶Экономика и региональные исследования
В региональной экономике пространственная автокорреляция помогает анализировать пространственное распределение доходов, безработицы, уровня преступности. Например, можно выявить, что бедные районы склонны группироваться вместе (положительная автокорреляция).
¶Социология и криминология
Исследователи используют пространственную автокорреляцию для анализа «горячих точек» преступности, распространения социальных явлений (например, голосования на выборах) или миграционных потоков.
¶Геоинформационные системы (ГИС)
В ГИС инструменты пространственной автокорреляции (например, в ArcGIS, QGIS, R, Python) встроены в модули пространственного анализа. Они позволяют проверять гипотезы о случайности распределения, строить карты кластеризации и выявлять пространственные закономерности.
¶Критика и ограничения
- Зависимость от выбора матрицы весов: результаты анализа чувствительны к определению соседства (например, на основе расстояния или границ). Разные матрицы весов могут давать противоположные выводы.
- Проблема MAUP (Modifiable Areal Unit Problem): при агрегировании данных по разным пространственным единицам (например, по районам или кварталам) результаты могут существенно различаться.
- Неоднородность территории: глобальные индексы могут скрывать локальные вариации, если на территории есть как кластеры, так и случайные области.
- Статистическая значимость: для оценки значимости часто используются перестановочные тесты, которые требуют большого числа итераций и могут быть чувствительны к выбросам.
¶Интересные факты
- Первый закон географии Тоблера часто называют «законом Тоблера», хотя сам Тоблер шутил, что это скорее «шутка, ставшая законом».
- Пространственная автокорреляция лежит в основе многих методов машинного обучения, таких как пространственные авторегрессионные модели (SAR) и модели с пространственной ошибкой (SEM).
- В России методы пространственной автокорреляции активно применяются в исследованиях Росстата и Института географии РАН для анализа демографических и экономических процессов.
¶Источники
- Tobler W. R. (1970). "A Computer Movie Simulating Urban Growth in the Detroit Region". Economic Geography, 46, 234–240.
- Moran P. A. P. (1950). "Notes on Continuous Stochastic Phenomena". Biometrika, 37(1/2), 17–23.
- Anselin L. (1995). "Local Indicators of Spatial Association—LISA". Geographical Analysis, 27(2), 93–115.
- Getis A., Ord J. K. (1992). "The Analysis of Spatial Association by Use of Distance Statistics". Geographical Analysis, 24(3), 189–206.
- Haining R. (2003). Spatial Data Analysis: Theory and Practice. Cambridge University Press.
- Боков В. А., Тикунов В. С. (2010). Пространственный анализ в геоинформатике. М.: Издательство МГУ.