Открыть сервис

U-критерий Манна-Уитни

U-критерий Манна-Уитни (также известный как критерий Манна-Уитни-Уилкоксона, или U-тест) — это непараметрический статистический критерий, используемый для оценки различий между двумя независимыми выборками по уровню какого-либо количественного или порядкового признака. Он относится к группе ранговых критериев и позволяет определить, является ли одна выборка статистически значимо «больше» или «меньше» другой, не предполагая нормального распределения данных.

История

Критерий был разработан в 1947 году американскими статистиками Генри Манном и Дональдом Уитни как обобщение и уточнение более раннего критерия, предложенного Фрэнком Уилкоксоном в 1945 году для выборок равного объёма. Манн и Уитни расширили метод на случай выборок разного размера и формализовали процедуру вычисления U-статистики. С тех пор критерий стал одним из наиболее распространённых непараметрических методов в биологии, медицине, психологии, социологии и других областях, где данные не соответствуют требованиям параметрических критериев (например, t-критерия Стьюдента).

Основные положения

Назначение и область применения

U-критерий Манна-Уитни применяется для проверки гипотезы о том, что две независимые выборки взяты из генеральных совокупностей с одинаковым распределением. В отличие от параметрических аналогов, он не требует нормальности распределения и равенства дисперсий, что делает его устойчивым к выбросам и пригодным для порядковых данных (например, рангов, баллов, оценок).

Критерий используется в ситуациях, когда:

  • Объём выборок мал (от 3 до 20 наблюдений в каждой).
  • Данные измерены в порядковой шкале или интервальной шкале, но не подчиняются нормальному закону.
  • Требуется сравнить две группы, например, контрольную и экспериментальную, до и после воздействия (при независимых выборках).

Ограничения

  • Критерий чувствителен к различиям в форме распределений (например, если одна выборка имеет большую дисперсию, чем другая, результат может быть искажён).
  • Не подходит для связанных (парных) выборок — в этом случае используется критерий Уилкоксона для парных сравнений.
  • При большом объёме выборок (более 20–30) распределение U-статистики аппроксимируется нормальным, что требует поправки на непрерывность.

Математическая формулировка

Исходные данные

Пусть имеются две независимые выборки: первая объёмом \(n_1\) и вторая объёмом \(n_2\). Наблюдения представляют собой значения признака \(X\) и \(Y\) соответственно. Все \(N = n_1 + n_2\) наблюдений объединяются в один ряд и ранжируются по возрастанию. Каждому значению присваивается ранг — порядковый номер в объединённом ряду (при совпадении значений используются средние ранги).

Вычисление U-статистики

U-статистика вычисляется как количество пар \((x_i, y_j)\), в которых значение из первой выборки меньше значения из второй выборки. Формально:

\[ U = \sum_{i=1}^{n_1} \sum_{j=1}^{n_2} \mathbf{1}(x_i < y_j) + 0.5 \cdot \mathbf{1}(x_i = y_j) \]

На практике U-статистику удобнее вычислять через суммы рангов. Пусть \(R_1\) — сумма рангов, присвоенных наблюдениям первой выборки, а \(R_2\) — второй. Тогда:

\[ U_1 = n_1 n_2 + \frac{n_1(n_1+1)}{2} - R_1 \] \[ U_2 = n_1 n_2 + \frac{n_2(n_2+1)}{2} - R_2 \]

При этом \(U_1 + U_2 = n_1 n_2\). В качестве тестовой статистики обычно берут меньшую из величин \(U_1\) и \(U_2\), обозначая её как \(U\).

Проверка гипотез

Нулевая гипотеза \(H_0\): распределения двух выборок одинаковы. Альтернативная гипотеза \(H_1\): распределения различаются (двусторонняя проверка) или одно распределение сдвинуто относительно другого (односторонняя проверка).

Для малых выборок (обычно \(n_1, n_2 \leq 20\)) критические значения U-статистики табулированы. Если вычисленное \(U\) меньше или равно табличному критическому значению для заданного уровня значимости \(\alpha\), нулевая гипотеза отвергается.

Для больших выборок используется нормальная аппроксимация:

\[ z = \frac{U - \mu_U}{\sigma_U} \]

где \(\mu_U = \frac{n_1 n_2}{2}\), \(\sigma_U = \sqrt{\frac{n_1 n_2 (n_1 + n_2 + 1)}{12}}\). Значение \(z\) сравнивается с критическими точками стандартного нормального распределения. При наличии совпадающих рангов вводится поправка на связанные ранги.

Пример использования

Рассмотрим гипотетический пример: сравнение времени реакции (в миллисекундах) у двух групп испытуемых — контрольной (n=5) и экспериментальной (n=5). Данные:

  • Контрольная: 250, 260, 270, 280, 300
  • Экспериментальная: 220, 240, 255, 265, 290

Объединяем и ранжируем:

  • 220 (1), 240 (2), 250 (3), 255 (4), 260 (5), 265 (6), 270 (7), 280 (8), 290 (9), 300 (10)

Сумма рангов контрольной: 3+5+7+8+10 = 33 Сумма рангов экспериментальной: 1+2+4+6+9 = 22

Вычисляем: \(U_1 = 5 \cdot 5 + \frac{5 \cdot 6}{2} - 33 = 25 + 15 - 33 = 7\) \(U_2 = 25 + 15 - 22 = 18\)

Меньшее значение \(U = 7\). По таблице критических значений для \(n_1=n_2=5\) при \(\alpha=0.05\) двустороннее критическое значение равно 2. Так как 7 > 2, нулевая гипотеза не отвергается — статистически значимых различий между группами не обнаружено.

Связь с другими критериями

U-критерий Манна-Уитни является непараметрическим аналогом t-критерия Стьюдента для независимых выборок. При выполнении предпосылок параметрического анализа (нормальность, гомоскедастичность) t-критерий обладает большей мощностью, но при их нарушении U-критерий часто оказывается более надёжным. Также существует обобщение на случай более двух групп — критерий Краскела-Уоллиса, который является непараметрическим аналогом однофакторного дисперсионного анализа.

Программная реализация

U-критерий Манна-Уитни реализован во всех основных статистических пакетах и языках программирования:

  • R: функция wilcox.test() с параметром paired = FALSE.
  • Python: функция mannwhitneyu() из модуля scipy.stats.
  • SPSS: процедура «Nonparametric Tests → Independent Samples».
  • Excel: с помощью надстройки «Пакет анализа» или ручного вычисления.

Критика и ограничения

Несмотря на широкую распространённость, критерий подвергается критике за то, что он проверяет не только сдвиг медиан, но и различия в форме распределений. При сильно различающихся дисперсиях и асимметрии результат может быть трудно интерпретируем. В таких случаях рекомендуют использовать более устойчивые методы, например, критерий Бруннера-Мунцеля или бутстреп-процедуры. Также при малых выборках (n<4) мощность критерия крайне низка, и его применение может быть нецелесообразным.

Источники

  • Mann, H. B., & Whitney, D. R. (1947). On a Test of Whether one of Two Random Variables is Stochastically Larger than the Other. Annals of Mathematical Statistics, 18(1), 50–60.
  • Wilcoxon, F. (1945). Individual Comparisons by Ranking Methods. Biometrics Bulletin, 1(6), 80–83.
  • Hollander, M., Wolfe, D. A., & Chicken, E. (2014). Nonparametric Statistical Methods (3rd ed.). Wiley.
  • Кобзарь, А. И. (2006). Прикладная математическая статистика. М.: Физматлит.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →