U-критерий Манна-Уитни
U-критерий Манна-Уитни (также известный как критерий Манна-Уитни-Уилкоксона, или U-тест) — это непараметрический статистический критерий, используемый для оценки различий между двумя независимыми выборками по уровню какого-либо количественного или порядкового признака. Он относится к группе ранговых критериев и позволяет определить, является ли одна выборка статистически значимо «больше» или «меньше» другой, не предполагая нормального распределения данных.
История
Критерий был разработан в 1947 году американскими статистиками Генри Манном и Дональдом Уитни как обобщение и уточнение более раннего критерия, предложенного Фрэнком Уилкоксоном в 1945 году для выборок равного объёма. Манн и Уитни расширили метод на случай выборок разного размера и формализовали процедуру вычисления U-статистики. С тех пор критерий стал одним из наиболее распространённых непараметрических методов в биологии, медицине, психологии, социологии и других областях, где данные не соответствуют требованиям параметрических критериев (например, t-критерия Стьюдента).
Основные положения
Назначение и область применения
U-критерий Манна-Уитни применяется для проверки гипотезы о том, что две независимые выборки взяты из генеральных совокупностей с одинаковым распределением. В отличие от параметрических аналогов, он не требует нормальности распределения и равенства дисперсий, что делает его устойчивым к выбросам и пригодным для порядковых данных (например, рангов, баллов, оценок).
Критерий используется в ситуациях, когда:
- Объём выборок мал (от 3 до 20 наблюдений в каждой).
- Данные измерены в порядковой шкале или интервальной шкале, но не подчиняются нормальному закону.
- Требуется сравнить две группы, например, контрольную и экспериментальную, до и после воздействия (при независимых выборках).
Ограничения
- Критерий чувствителен к различиям в форме распределений (например, если одна выборка имеет большую дисперсию, чем другая, результат может быть искажён).
- Не подходит для связанных (парных) выборок — в этом случае используется критерий Уилкоксона для парных сравнений.
- При большом объёме выборок (более 20–30) распределение U-статистики аппроксимируется нормальным, что требует поправки на непрерывность.
Математическая формулировка
Исходные данные
Пусть имеются две независимые выборки: первая объёмом \(n_1\) и вторая объёмом \(n_2\). Наблюдения представляют собой значения признака \(X\) и \(Y\) соответственно. Все \(N = n_1 + n_2\) наблюдений объединяются в один ряд и ранжируются по возрастанию. Каждому значению присваивается ранг — порядковый номер в объединённом ряду (при совпадении значений используются средние ранги).
Вычисление U-статистики
U-статистика вычисляется как количество пар \((x_i, y_j)\), в которых значение из первой выборки меньше значения из второй выборки. Формально:
\[ U = \sum_{i=1}^{n_1} \sum_{j=1}^{n_2} \mathbf{1}(x_i < y_j) + 0.5 \cdot \mathbf{1}(x_i = y_j) \]
На практике U-статистику удобнее вычислять через суммы рангов. Пусть \(R_1\) — сумма рангов, присвоенных наблюдениям первой выборки, а \(R_2\) — второй. Тогда:
\[ U_1 = n_1 n_2 + \frac{n_1(n_1+1)}{2} - R_1 \] \[ U_2 = n_1 n_2 + \frac{n_2(n_2+1)}{2} - R_2 \]
При этом \(U_1 + U_2 = n_1 n_2\). В качестве тестовой статистики обычно берут меньшую из величин \(U_1\) и \(U_2\), обозначая её как \(U\).
Проверка гипотез
Нулевая гипотеза \(H_0\): распределения двух выборок одинаковы. Альтернативная гипотеза \(H_1\): распределения различаются (двусторонняя проверка) или одно распределение сдвинуто относительно другого (односторонняя проверка).
Для малых выборок (обычно \(n_1, n_2 \leq 20\)) критические значения U-статистики табулированы. Если вычисленное \(U\) меньше или равно табличному критическому значению для заданного уровня значимости \(\alpha\), нулевая гипотеза отвергается.
Для больших выборок используется нормальная аппроксимация:
\[ z = \frac{U - \mu_U}{\sigma_U} \]
где \(\mu_U = \frac{n_1 n_2}{2}\), \(\sigma_U = \sqrt{\frac{n_1 n_2 (n_1 + n_2 + 1)}{12}}\). Значение \(z\) сравнивается с критическими точками стандартного нормального распределения. При наличии совпадающих рангов вводится поправка на связанные ранги.
Пример использования
Рассмотрим гипотетический пример: сравнение времени реакции (в миллисекундах) у двух групп испытуемых — контрольной (n=5) и экспериментальной (n=5). Данные:
- Контрольная: 250, 260, 270, 280, 300
- Экспериментальная: 220, 240, 255, 265, 290
Объединяем и ранжируем:
- 220 (1), 240 (2), 250 (3), 255 (4), 260 (5), 265 (6), 270 (7), 280 (8), 290 (9), 300 (10)
Сумма рангов контрольной: 3+5+7+8+10 = 33 Сумма рангов экспериментальной: 1+2+4+6+9 = 22
Вычисляем: \(U_1 = 5 \cdot 5 + \frac{5 \cdot 6}{2} - 33 = 25 + 15 - 33 = 7\) \(U_2 = 25 + 15 - 22 = 18\)
Меньшее значение \(U = 7\). По таблице критических значений для \(n_1=n_2=5\) при \(\alpha=0.05\) двустороннее критическое значение равно 2. Так как 7 > 2, нулевая гипотеза не отвергается — статистически значимых различий между группами не обнаружено.
Связь с другими критериями
U-критерий Манна-Уитни является непараметрическим аналогом t-критерия Стьюдента для независимых выборок. При выполнении предпосылок параметрического анализа (нормальность, гомоскедастичность) t-критерий обладает большей мощностью, но при их нарушении U-критерий часто оказывается более надёжным. Также существует обобщение на случай более двух групп — критерий Краскела-Уоллиса, который является непараметрическим аналогом однофакторного дисперсионного анализа.
Программная реализация
U-критерий Манна-Уитни реализован во всех основных статистических пакетах и языках программирования:
- R: функция
wilcox.test()с параметромpaired = FALSE. - Python: функция
mannwhitneyu()из модуляscipy.stats. - SPSS: процедура «Nonparametric Tests → Independent Samples».
- Excel: с помощью надстройки «Пакет анализа» или ручного вычисления.
Критика и ограничения
Несмотря на широкую распространённость, критерий подвергается критике за то, что он проверяет не только сдвиг медиан, но и различия в форме распределений. При сильно различающихся дисперсиях и асимметрии результат может быть трудно интерпретируем. В таких случаях рекомендуют использовать более устойчивые методы, например, критерий Бруннера-Мунцеля или бутстреп-процедуры. Также при малых выборках (n<4) мощность критерия крайне низка, и его применение может быть нецелесообразным.
Источники
- Mann, H. B., & Whitney, D. R. (1947). On a Test of Whether one of Two Random Variables is Stochastically Larger than the Other. Annals of Mathematical Statistics, 18(1), 50–60.
- Wilcoxon, F. (1945). Individual Comparisons by Ranking Methods. Biometrics Bulletin, 1(6), 80–83.
- Hollander, M., Wolfe, D. A., & Chicken, E. (2014). Nonparametric Statistical Methods (3rd ed.). Wiley.
- Кобзарь, А. И. (2006). Прикладная математическая статистика. М.: Физматлит.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →