Открыть сервис

I-статистика Морана

I-статистика Морана (также индекс Морана, коэффициент пространственной автокорреляции Морана) — это статистический показатель, используемый для оценки наличия и силы пространственной автокорреляции в данных. Он измеряет, насколько значения переменной в соседних географических точках (или полигонах) коррелируют друг с другом, то есть являются ли они более схожими (положительная автокорреляция) или более различными (отрицательная автокорреляция), чем можно было бы ожидать при случайном распределении. Индекс назван в честь австралийского статистика Пэта Морана (Patrick Moran), который предложил его в 1950 году.

История

Концепция пространственной автокорреляции возникла в контексте анализа пространственных данных, который активно развивался в середине XX века. Пэт Моран, работавший в области биометрии и статистики, в 1950 году опубликовал статью «Notes on Continuous Stochastic Phenomena», где впервые представил I-статистику как меру связи между значениями переменной в соседних регионах. Изначально индекс применялся в экологии и географии для изучения распространения видов и пространственных закономерностей. Впоследствии, с развитием географических информационных систем (ГИС) и пространственной эконометрики в 1970–1980-х годах, I-статистика Морана стала одним из основных инструментов анализа пространственных данных, используемых в экономике, эпидемиологии, социологии и других науках.

Определение и формула

I-статистика Морана вычисляется по формуле:

\[ I = \frac{n}{\sum_{i=1}^{n} \sum_{j=1}^{n} w_{ij}} \cdot \frac{\sum_{i=1}^{n} \sum_{j=1}^{n} w_{ij} (x_i - \bar{x})(x_j - \bar{x})}{\sum_{i=1}^{n} (x_i - \bar{x})^2} \]

где:

  • \(n\) — количество пространственных единиц (точек или полигонов);
  • \(x_i\) — значение переменной в \(i\)-й единице;
  • \(\bar{x}\) — среднее арифметическое всех значений;
  • \(w_{ij}\) — элемент матрицы пространственных весов, отражающий соседство между единицами \(i\) и \(j\) (обычно \(w_{ij} = 1\), если единицы соседние, и \(0\) в противном случае; диагональные элементы \(w_{ii}\) обычно равны нулю).

Значение I варьируется от \(-1\) до \(+1\):

  • I > 0 указывает на положительную пространственную автокорреляцию: соседние единицы имеют схожие значения (кластеризация);
  • I < 0 указывает на отрицательную пространственную автокорреляцию: соседние единицы имеют различные значения (дисперсия);
  • I ≈ 0 означает отсутствие пространственной автокорреляции (случайное распределение).

Матрица пространственных весов

Ключевым элементом в расчёте I-статистики является матрица пространственных весов \(W\), которая определяет, какие единицы считаются соседними. Существует несколько подходов к её построению:

  • Смежность по границе (contiguity): единицы считаются соседними, если они имеют общую границу. Используется для полигональных данных (например, районы города).
  • Расстояние (distance-based): соседями считаются все единицы, находящиеся в пределах заданного радиуса от центральной точки.
  • K-ближайших соседей (k-nearest neighbors): для каждой единицы выбирается фиксированное число \(k\) ближайших соседей.
  • Обратное расстояние (inverse distance): веса обратно пропорциональны расстоянию между единицами, что позволяет учитывать влияние всех точек, но с убывающей силой.

Матрица весов обычно нормализуется (например, по строкам), чтобы сумма весов для каждой единицы равнялась 1, что упрощает интерпретацию.

Интерпретация и статистическая значимость

Значение I-статистики само по себе не указывает на статистическую значимость. Для проверки гипотезы о наличии пространственной автокорреляции используется тест, основанный на предположении о случайном распределении значений. Обычно вычисляется ожидаемое значение \(E(I)\) при случайном распределении:

\[ E(I) = -\frac{1}{n-1} \]

Для больших \(n\) \(E(I)\) близко к нулю. Затем рассчитывается дисперсия \(Var(I)\) (зависит от матрицы весов и распределения данных), и вычисляется z-статистика:

\[ z = \frac{I - E(I)}{\sqrt{Var(I)}} \]

По z-значению определяется p-значение. Если p-значение меньше выбранного уровня значимости (например, 0,05), то нулевая гипотеза о случайном распределении отвергается, и пространственная автокреляция считается статистически значимой.

Применение

I-статистика Морана широко используется в различных областях:

  • География и региональная экономика: анализ пространственной концентрации экономической активности, доходов, безработицы. Например, выявление кластеров богатых и бедных регионов.
  • Экология и биология: изучение распространения видов, миграции животных, пространственной структуры популяций.
  • Эпидемиология: картографирование заболеваемости (например, рака или инфекционных болезней) для выявления очагов и оценки влияния пространственных факторов.
  • Социология и криминология: анализ пространственного распределения преступности, социального неравенства, голосования.
  • Геоинформатика: проверка пространственной зависимости перед применением регрессионных моделей (например, в пространственной эконометрике).

Разновидности и модификации

Существуют несколько модификаций I-статистики Морана:

  • Локальный индекс Морана (Local Moran's I): предложен американским географом Люком Анселином (Luc Anselin) в 1995 году. Позволяет оценить пространственную автокорреляцию для каждой отдельной единицы, выявляя локальные кластеры и выбросы. Используется для построения карт LISA (Local Indicators of Spatial Association).
  • Глобальный индекс Морана (Global Moran's I): описывает общую тенденцию для всей области.
  • Морановский I для бинарных данных: адаптирован для анализа пространственной автокорреляции дихотомических переменных (например, наличие/отсутствие признака).

Критика и ограничения

I-статистика Морана имеет ряд ограничений:

  • Чувствительность к выбору матрицы весов: разные способы определения соседства могут приводить к различным результатам, что требует обоснования выбора.
  • Предположение о стационарности: индекс предполагает, что среднее и дисперсия данных постоянны по всей области, что не всегда выполняется в реальных данных.
  • Влияние выбросов: единичные экстремальные значения могут искажать глобальную оценку.
  • Размер и форма единиц: результаты зависят от границ и размеров пространственных единиц (проблема модифицируемой ареальной единицы — MAUP).
  • Не учитывает нелинейные зависимости: I-статистика измеряет только линейную корреляцию между соседними значениями.

Пример

Рассмотрим гипотетический пример: данные о среднегодовом доходе на душу населения в 10 районах города. Если районы с высоким доходом соседствуют друг с другом, а районы с низким доходом — друг с другом, то I-статистика будет положительной и значимой, указывая на пространственную кластеризацию. Если же богатые и бедные районы чередуются, I будет отрицательной.

См. также

Литература

  • Moran, P. A. P. (1950). Notes on Continuous Stochastic Phenomena. Biometrika, 37(1–2), 17–23.
  • Anselin, L. (1995). Local Indicators of Spatial Association—LISA. Geographical Analysis, 27(2), 93–115.
  • Cliff, A. D., & Ord, J. K. (1981). Spatial Processes: Models & Applications. Pion.
  • Bivand, R. S., Pebesma, E. J., & Gómez-Rubio, V. (2013). Applied Spatial Data Analysis with R. Springer.