I-статистика Морана¶
I-статистика Морана (также индекс Морана, коэффициент пространственной автокорреляции Морана) — это статистический показатель, используемый для оценки наличия и силы пространственной автокорреляции в данных. Он измеряет, насколько значения переменной в соседних географических точках (или полигонах) коррелируют друг с другом, то есть являются ли они более схожими (положительная автокорреляция) или более различными (отрицательная автокорреляция), чем можно было бы ожидать при случайном распределении. Индекс назван в честь австралийского статистика Пэта Морана (Patrick Moran), который предложил его в 1950 году.
¶История
Концепция пространственной автокорреляции возникла в контексте анализа пространственных данных, который активно развивался в середине XX века. Пэт Моран, работавший в области биометрии и статистики, в 1950 году опубликовал статью «Notes on Continuous Stochastic Phenomena», где впервые представил I-статистику как меру связи между значениями переменной в соседних регионах. Изначально индекс применялся в экологии и географии для изучения распространения видов и пространственных закономерностей. Впоследствии, с развитием географических информационных систем (ГИС) и пространственной эконометрики в 1970–1980-х годах, I-статистика Морана стала одним из основных инструментов анализа пространственных данных, используемых в экономике, эпидемиологии, социологии и других науках.
¶Определение и формула
I-статистика Морана вычисляется по формуле:
\[ I = \frac{n}{\sum_{i=1}^{n} \sum_{j=1}^{n} w_{ij}} \cdot \frac{\sum_{i=1}^{n} \sum_{j=1}^{n} w_{ij} (x_i - \bar{x})(x_j - \bar{x})}{\sum_{i=1}^{n} (x_i - \bar{x})^2} \]
где:
- \(n\) — количество пространственных единиц (точек или полигонов);
- \(x_i\) — значение переменной в \(i\)-й единице;
- \(\bar{x}\) — среднее арифметическое всех значений;
- \(w_{ij}\) — элемент матрицы пространственных весов, отражающий соседство между единицами \(i\) и \(j\) (обычно \(w_{ij} = 1\), если единицы соседние, и \(0\) в противном случае; диагональные элементы \(w_{ii}\) обычно равны нулю).
Значение I варьируется от \(-1\) до \(+1\):
- I > 0 указывает на положительную пространственную автокорреляцию: соседние единицы имеют схожие значения (кластеризация);
- I < 0 указывает на отрицательную пространственную автокорреляцию: соседние единицы имеют различные значения (дисперсия);
- I ≈ 0 означает отсутствие пространственной автокорреляции (случайное распределение).
¶Матрица пространственных весов
Ключевым элементом в расчёте I-статистики является матрица пространственных весов \(W\), которая определяет, какие единицы считаются соседними. Существует несколько подходов к её построению:
- Смежность по границе (contiguity): единицы считаются соседними, если они имеют общую границу. Используется для полигональных данных (например, районы города).
- Расстояние (distance-based): соседями считаются все единицы, находящиеся в пределах заданного радиуса от центральной точки.
- K-ближайших соседей (k-nearest neighbors): для каждой единицы выбирается фиксированное число \(k\) ближайших соседей.
- Обратное расстояние (inverse distance): веса обратно пропорциональны расстоянию между единицами, что позволяет учитывать влияние всех точек, но с убывающей силой.
Матрица весов обычно нормализуется (например, по строкам), чтобы сумма весов для каждой единицы равнялась 1, что упрощает интерпретацию.
¶Интерпретация и статистическая значимость
Значение I-статистики само по себе не указывает на статистическую значимость. Для проверки гипотезы о наличии пространственной автокорреляции используется тест, основанный на предположении о случайном распределении значений. Обычно вычисляется ожидаемое значение \(E(I)\) при случайном распределении:
\[ E(I) = -\frac{1}{n-1} \]
Для больших \(n\) \(E(I)\) близко к нулю. Затем рассчитывается дисперсия \(Var(I)\) (зависит от матрицы весов и распределения данных), и вычисляется z-статистика:
\[ z = \frac{I - E(I)}{\sqrt{Var(I)}} \]
По z-значению определяется p-значение. Если p-значение меньше выбранного уровня значимости (например, 0,05), то нулевая гипотеза о случайном распределении отвергается, и пространственная автокреляция считается статистически значимой.
¶Применение
I-статистика Морана широко используется в различных областях:
- География и региональная экономика: анализ пространственной концентрации экономической активности, доходов, безработицы. Например, выявление кластеров богатых и бедных регионов.
- Экология и биология: изучение распространения видов, миграции животных, пространственной структуры популяций.
- Эпидемиология: картографирование заболеваемости (например, рака или инфекционных болезней) для выявления очагов и оценки влияния пространственных факторов.
- Социология и криминология: анализ пространственного распределения преступности, социального неравенства, голосования.
- Геоинформатика: проверка пространственной зависимости перед применением регрессионных моделей (например, в пространственной эконометрике).
¶Разновидности и модификации
Существуют несколько модификаций I-статистики Морана:
- Локальный индекс Морана (Local Moran's I): предложен американским географом Люком Анселином (Luc Anselin) в 1995 году. Позволяет оценить пространственную автокорреляцию для каждой отдельной единицы, выявляя локальные кластеры и выбросы. Используется для построения карт LISA (Local Indicators of Spatial Association).
- Глобальный индекс Морана (Global Moran's I): описывает общую тенденцию для всей области.
- Морановский I для бинарных данных: адаптирован для анализа пространственной автокорреляции дихотомических переменных (например, наличие/отсутствие признака).
¶Критика и ограничения
I-статистика Морана имеет ряд ограничений:
- Чувствительность к выбору матрицы весов: разные способы определения соседства могут приводить к различным результатам, что требует обоснования выбора.
- Предположение о стационарности: индекс предполагает, что среднее и дисперсия данных постоянны по всей области, что не всегда выполняется в реальных данных.
- Влияние выбросов: единичные экстремальные значения могут искажать глобальную оценку.
- Размер и форма единиц: результаты зависят от границ и размеров пространственных единиц (проблема модифицируемой ареальной единицы — MAUP).
- Не учитывает нелинейные зависимости: I-статистика измеряет только линейную корреляцию между соседними значениями.
¶Пример
Рассмотрим гипотетический пример: данные о среднегодовом доходе на душу населения в 10 районах города. Если районы с высоким доходом соседствуют друг с другом, а районы с низким доходом — друг с другом, то I-статистика будет положительной и значимой, указывая на пространственную кластеризацию. Если же богатые и бедные районы чередуются, I будет отрицательной.
¶См. также
- Пространственная автокорреляция
- C-статистика Гири
- Пространственная эконометрика
- Географическая информационная система
¶Литература
- Moran, P. A. P. (1950). Notes on Continuous Stochastic Phenomena. Biometrika, 37(1–2), 17–23.
- Anselin, L. (1995). Local Indicators of Spatial Association—LISA. Geographical Analysis, 27(2), 93–115.
- Cliff, A. D., & Ord, J. K. (1981). Spatial Processes: Models & Applications. Pion.
- Bivand, R. S., Pebesma, E. J., & Gómez-Rubio, V. (2013). Applied Spatial Data Analysis with R. Springer.