Критерий Краскела-Уоллиса
Критерий Краскела-Уоллиса (также известный как H-тест Краскела-Уоллиса или однофакторный дисперсионный анализ рангов) — это непараметрический статистический критерий, используемый для проверки гипотезы о равенстве медиан трёх и более независимых выборок. Он является обобщением U-критерия Манна-Уитни на случай нескольких групп и применяется, когда нарушаются предположения параметрического однофакторного дисперсионного анализа (ANOVA), в частности, требование нормальности распределения данных.
История
Критерий был разработан американскими статистиками Уильямом Генри Краскелом и Уилсоном Алленом Уоллисом. В 1952 году они опубликовали статью «Use of Ranks in One-Criterion Variance Analysis» в журнале Journal of the American Statistical Association, где впервые представили этот метод. Разработка критерия была мотивирована необходимостью анализа данных, которые не соответствуют условиям параметрической ANOVA, особенно в биологических и социальных науках, где распределения часто являются асимметричными или содержат выбросы.
Основные понятия
Непараметрический подход
В отличие от параметрических тестов, критерий Краскела-Уоллиса не требует, чтобы данные были взяты из нормально распределённой совокупности. Он основан на рангах наблюдений, а не на их исходных значениях. Это делает его устойчивым к выбросам и пригодным для порядковых данных.
Ранжирование
Для вычисления критерия все наблюдения из всех выборок объединяются в один общий массив и упорядочиваются по возрастанию. Каждому наблюдению присваивается ранг — его порядковый номер в этом объединённом массиве. В случае совпадающих значений (связей) используется средний ранг.
Математическая формулировка
Статистика H
Статистика критерия Краскела-Уоллиса обозначается как H и вычисляется по формуле:
\[ H = \frac{12}{N(N+1)} \sum_{i=1}^{k} \frac{R_i^2}{n_i} - 3(N+1) \]
где:
- \( k \) — количество сравниваемых групп,
- \( n_i \) — размер i-й выборки,
- \( N \) — общее количество наблюдений (\( N = \sum_{i=1}^{k} n_i \)),
- \( R_i \) — сумма рангов в i-й выборке.
Поправка на связи
При наличии большого количества совпадающих значений (связей) в данные вносится поправка. Статистика H делится на поправочный коэффициент:
\[ C = 1 - \frac{\sum_{j=1}^{m} (t_j^3 - t_j)}{N^3 - N} \]
где \( m \) — количество групп связей, а \( t_j \) — размер j-й группы связей. Скорректированная статистика имеет вид \( H_{adj} = H / C \).
Распределение статистики
При справедливости нулевой гипотезы (медианы всех групп равны) и при условии, что размеры выборок \( n_i \) достаточно велики (обычно \( n_i > 5 \)), статистика H аппроксимируется распределением хи-квадрат с \( k-1 \) степенями свободы. Для малых выборок используются точные таблицы критических значений, которые были рассчитаны Краскелом и Уоллисом.
Процедура применения
Этапы тестирования
- Формулировка гипотез:
- Нулевая гипотеза \( H_0 \): медианы всех \( k \) совокупностей равны.
- Альтернативная гипотеза \( H_1 \): хотя бы одна медиана отличается от других.
- Сбор данных: Получение независимых выборок из \( k \) групп.
- Ранжирование: Присвоение рангов всем наблюдениям в объединённом наборе данных.
- Вычисление статистики: Расчёт H по формуле.
- Принятие решения: Сравнение полученного значения H с критическим значением распределения хи-квадрат с \( k-1 \) степенями свободы при заданном уровне значимости \( \alpha \) (обычно 0,05). Если \( H > \chi^2_{крит} \), нулевая гипотеза отвергается.
Пример
Предположим, требуется сравнить эффективность трёх методов обучения (A, B, C) на основе результатов тестов. Выборки независимы, распределение результатов неизвестно. После ранжирования всех 15 результатов (по 5 на каждый метод) и вычисления сумм рангов, получено H = 7,2. Критическое значение \( \chi^2_{0,05; 2} = 5,99 \). Так как 7,2 > 5,99, нулевая гипотеза о равенстве медиан отвергается, что свидетельствует о статистически значимых различиях между методами.
Сравнение с другими критериями
Отличие от ANOVA
Параметрический однофакторный дисперсионный анализ (ANOVA) проверяет гипотезу о равенстве средних и требует нормальности распределения и гомогенности дисперсий. Критерий Краскела-Уоллиса проверяет гипотезу о равенстве медиан и не имеет этих требований. При соблюдении условий параметрического теста, ANOVA обладает большей статистической мощностью (способностью обнаружить эффект, если он существует). Однако при нарушении нормальности, особенно на малых выборках, критерий Краскела-Уоллиса может быть более надёжным.
Связь с U-критерием Манна-Уитни
Критерий Краскела-Уоллиса является прямым обобщением U-критерия Манна-Уитни для двух выборок. Если применить H-тест к двум группам, он даст те же результаты, что и U-тест (с точностью до преобразования статистики).
Апостериорные сравнения
Если нулевая гипотеза отвергается, необходимо определить, какие именно группы различаются. Для этого используются апостериорные (post-hoc) тесты, адаптированные для непараметрического случая:
- Критерий Данна: наиболее распространённый метод, который выполняет попарные сравнения с коррекцией на множественные сравнения (например, поправка Бонферрони).
- Критерий Коновера-Имана: альтернативный метод, основанный на рангах.
- Критерий Неменьи: используется для сравнения всех групп с контрольной.
Применение
Области использования
Критерий Краскела-Уоллиса широко применяется в различных областях, где данные не соответствуют нормальному распределению:
- Медицина и фармакология: сравнение эффективности нескольких методов лечения, когда показатели (например, уровень боли по шкале) являются порядковыми.
- Биология и экология: анализ различий в видовом разнообразии между несколькими типами местообитаний.
- Психология и социология: сравнение результатов опросов по шкалам Ликерта между несколькими группами респондентов.
- Экономика: анализ различий в доходах или потребительских предпочтениях между несколькими регионами.
Примеры в российской науке
В российской научной литературе критерий Краскела-Уоллиса часто используется в диссертациях по медицине и биологии. Например, при оценке влияния различных доз удобрений на урожайность сельскохозяйственных культур, когда распределение урожайности не является нормальным.
Ограничения
- Независимость выборок: Критерий предполагает, что наблюдения внутри и между группами независимы. Для зависимых выборок (например, повторные измерения) следует использовать критерий Фридмана.
- Порядковая шкала: Критерий работает с данными, измеренными как минимум в порядковой шкале. Для номинальных данных он неприменим.
- Мощность: При соблюдении условий параметрического теста, мощность H-теста ниже, чем у ANOVA, особенно на малых выборках. Однако при значительных отклонениях от нормальности мощность может быть выше.
- Интерпретация: Отвержение нулевой гипотезы указывает на то, что хотя бы одна медиана отличается, но не говорит о том, какие именно группы различаются. Требуется проведение дополнительных post-hoc тестов.
Реализация в программном обеспечении
Критерий Краскела-Уоллиса реализован во всех основных статистических пакетах:
- R: функция
kruskal.test()из базового пакетаstats. - Python: функция
kruskal()из модуляscipy.stats. - SPSS: команда
NPAR TESTS /K-W. - MATLAB: функция
kruskalwallis(). - Microsoft Excel: реализация отсутствует в стандартном наборе, но может быть выполнена с помощью надстроек или ручного расчёта.
Источники
- Kruskal, W. H., & Wallis, W. A. (1952). Use of Ranks in One-Criterion Variance Analysis. Journal of the American Statistical Association, 47(260), 583–621.
- Hollander, M., Wolfe, D. A., & Chicken, E. (2014). Nonparametric Statistical Methods (3rd ed.). John Wiley & Sons.
- Siegel, S., & Castellan, N. J. (1988). Nonparametric Statistics for the Behavioral Sciences (2nd ed.). McGraw-Hill.
- Гмурман, В. Е. (2004). Теория вероятностей и математическая статистика (9-е изд.). Высшая школа.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →