Открыть сервис

Связанный ранг

Связанный ранг (англ. tied rank) — это статистический показатель, используемый в непараметрической статистике и теории ранговых критериев, который присваивается наблюдениям в выборке при наличии одинаковых значений (связок). В отличие от обычного ранга, который уникален для каждого элемента, связанный ранг представляет собой среднее арифметическое тех рангов, которые эти элементы заняли бы, если бы не были равны. Связанные ранги применяются в ранговых критериях (например, критерий Манна — Уитни, критерий Уилкоксона, критерий Краскела — Уоллиса) для корректного учёта повторяющихся данных, что позволяет избежать смещения оценок и сохранить мощность статистических тестов.

Определение и математическая формулировка

В классической ранговой статистике каждому элементу выборки присваивается порядковый номер (ранг) от 1 до \(n\) в порядке возрастания значений. Если два или более элемента имеют одинаковое значение (образуют связку), то им присваивается одинаковый связанный ранг, равный среднему арифметическому тех рангов, которые они заняли бы при отсутствии равенства.

Формально: пусть имеется \(k\) элементов, образующих связку, и пусть они занимают позиции от \(r\) до \(r + k - 1\) в упорядоченном ряду. Тогда связанный ранг \(R_{\text{св}}\) для каждого из этих элементов вычисляется по формуле:

\[ R_{\text{св}} = \frac{r + (r+1) + \dots + (r+k-1)}{k} = \frac{2r + k - 1}{2} \]

Например, если в выборке из 10 наблюдений три элемента равны и занимают в упорядоченном ряду позиции 4, 5 и 6, то их связанный ранг составит \((4+5+6)/3 = 5\). Если связка состоит из двух элементов на позициях 7 и 8, то связанный ранг — \((7+8)/2 = 7,5\).

История возникновения

Понятие связанного ранга возникло в середине XX века в связи с развитием непараметрических методов статистического анализа. Ранговые критерии, предложенные Фрэнком Уилкоксоном (1945) и Генри Манном с Дональдом Уитни (1947), изначально предполагали отсутствие повторяющихся значений. Однако на практике в реальных данных (например, в биомедицинских исследованиях, социологических опросах, инженерных измерениях) часто встречаются одинаковые наблюдения, особенно при дискретных шкалах или округлении.

В 1950-х годах статистики, в том числе Уильям Краскел и Уилсон Уоллис, разработали модификации ранговых критериев, учитывающие связки. Введение связанных рангов позволило сохранить асимптотические свойства тестов и избежать потери информации. В 1960-х годах методы были формализованы в работах Мориса Кендалла и Алана Стюарта, а также в учебниках по непараметрической статистике (например, «Nonparametric Statistics for the Behavioral Sciences» Сидни Сигела, 1956).

Свойства и характеристики

Сумма связанных рангов

Сумма всех рангов (включая связанные) в выборке объёмом \(n\) всегда равна \(n(n+1)/2\), независимо от наличия связок. Это свойство используется для проверки правильности вычислений.

Влияние на дисперсию

При наличии связок дисперсия рангов уменьшается по сравнению с теоретической дисперсией для уникальных значений. Это требует коррекции в статистических тестах, например, введения поправочного коэффициента для критерия Манна — Уитни или Краскела — Уоллиса.

Поправка на связки

Для многих ранговых критериев (например, критерий Уилкоксона для парных сравнений, критерий Краскела — Уоллиса) используется поправка на связки, которая учитывает количество и размер связок. Поправка выражается формулой:

\[ \text{Поправка} = 1 - \frac{\sum_{i=1}^{m} (t_i^3 - t_i)}{n^3 - n} \]

где \(m\) — число связок, \(t_i\) — размер \(i\)-й связки, \(n\) — общий объём выборки. Эта поправка корректирует стандартную ошибку тестовой статистики.

Применение в статистических критериях

Критерий Манна — Уитни

При сравнении двух независимых выборок с помощью критерия Манна — Уитни (U-тест) связанные ранги используются для расчёта суммы рангов каждой группы. Если в объединённой выборке есть связки, то вычисление U-статистики производится по стандартной формуле, но с учётом связанных рангов. Для больших выборок (n > 20) применяется аппроксимация к нормальному распределению с поправкой на связки.

Критерий Уилкоксона для парных сравнений

В критерии Уилкоксона для зависимых выборок (знаковый ранговый критерий) связанные ранги присваиваются абсолютным значениям разностей, если некоторые разности равны по модулю. Нулевые разности (когда значения в паре совпадают) обычно исключаются из анализа, но если ненулевые разности образуют связки, то используется связанный ранг.

Критерий Краскела — Уоллиса

Для сравнения трёх и более независимых выборок (однофакторный дисперсионный анализ на рангах) связанные ранги присваиваются всем наблюдениям в объединённой выборке. H-статистика Краскела — Уоллиса корректируется с помощью поправочного коэффициента на связки, что повышает точность аппроксимации к распределению хи-квадрат.

Другие критерии

Связанные ранги также используются в критерии знаков (для бинарных данных), критерии Фридмана (для повторных измерений), критерии Джонкхиера — Терпстры (для упорядоченных альтернатив) и в ранговой корреляции Спирмена (при вычислении коэффициента с поправкой на связки).

Преимущества и ограничения

Преимущества

  • Корректность: связанные ранги позволяют применять ранговые критерии к данным с повторяющимися значениями без потери статистической мощности.
  • Универсальность: метод работает с любыми типами данных (порядковые, интервальные, относительные) при условии возможности упорядочивания.
  • Робастность: ранговые критерии со связанными рангами устойчивы к выбросам и не требуют нормального распределения данных.

Ограничения

  • Потеря информации: при большом количестве связок (например, в дискретных данных с малым числом уникальных значений) ранговые критерии могут терять чувствительность, так как информация о тонких различиях между наблюдениями нивелируется.
  • Сложность вычислений: при ручном расчёте связанные ранги требуют дополнительных шагов, особенно при большом числе связок. Однако современные статистические пакеты (R, SPSS, Python с библиотекой SciPy) автоматически обрабатывают связки.
  • Асимптотические приближения: при малых выборках и большом числе связок аппроксимации к нормальному распределению или распределению хи-квадрат могут быть неточными. В таких случаях рекомендуется использовать точные перестановочные тесты.

Пример расчёта

Рассмотрим выборку из 8 наблюдений: 3, 5, 5, 7, 7, 7, 9, 10. Упорядочим по возрастанию:

  • 3 (позиция 1) → ранг 1
  • 5, 5 (позиции 2 и 3) → связанный ранг (2+3)/2 = 2,5
  • 7, 7, 7 (позиции 4, 5, 6) → связанный ранг (4+5+6)/3 = 5
  • 9 (позиция 7) → ранг 7
  • 10 (позиция 8) → ранг 8

Сумма рангов: 1 + 2,5 + 2,5 + 5 + 5 + 5 + 7 + 8 = 36, что равно \(8 \cdot 9 / 2 = 36\).

Критика и альтернативы

Некоторые статистики (например, Брэдли Эфрон) отмечают, что введение связанных рангов может приводить к смещению в оценках эффекта при большом числе связок, особенно в малых выборках. Альтернативой является использование точных перестановочных тестов, которые не требуют аппроксимаций, или применение методов бутстрепа. Для дискретных данных с малым числом уникальных значений рекомендуются специализированные тесты, такие как критерий Макнамары (для бинарных данных) или критерий Кохрена (для многомерных бинарных данных).

В современной статистике связанные ранги остаются стандартным инструментом, реализованным во всех основных статистических пакетах. Они широко применяются в медицине, психологии, экологии, социологии и инженерии для анализа данных, не удовлетворяющих условиям параметрических тестов.

Источники

  1. Siegel, S. (1956). Nonparametric Statistics for the Behavioral Sciences. McGraw-Hill.
  2. Mann, H. B., & Whitney, D. R. (1947). On a Test of Whether one of Two Random Variables is Stochastically Larger than the Other. Annals of Mathematical Statistics, 18(1), 50–60.
  3. Kruskal, W. H., & Wallis, W. A. (1952). Use of Ranks in One-Criterion Variance Analysis. Journal of the American Statistical Association, 47(260), 583–621.
  4. Hollander, M., & Wolfe, D. A. (1999). Nonparametric Statistical Methods (2nd ed.). Wiley.
  5. Lehmann, E. L. (1975). Nonparametrics: Statistical Methods Based on Ranks. Holden-Day.
  6. Efron, B., & Tibshirani, R. J. (1993). An Introduction to the Bootstrap. Chapman & Hall.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →