Тест Шапиро-Уилка¶
Тест Шапиро-Уилка — это статистический критерий, предназначенный для проверки гипотезы о том, что анализируемая выборка данных извлечена из нормально распределённой генеральной совокупности. Относится к классу критериев согласия (goodness-of-fit tests) и является одним из наиболее мощных (чувствительных) тестов для проверки нормальности, особенно при малых объёмах выборки. Разработан Сэмюэлем Шапиро и Мартином Уилком в 1965 году.
¶История
Тест был предложен в 1965 году в статье «An Analysis of Variance Test for Normality (Complete Samples)», опубликованной в журнале Biometrika. Авторы, Сэмюэль Шапиро (США) и Мартин Уилк (Канада), предложили метод, основанный на анализе упорядоченных статистик и их ожидаемых значений при нормальном распределении. До появления теста Шапиро-Уилка основными критериями нормальности были тесты, основанные на асимметрии и эксцессе (например, критерий Д'Агостино), а также критерий Колмогорова-Смирнова, который, однако, показал низкую мощность для малых выборок. Тест Шапиро-Уилка быстро завоевал популярность благодаря своей высокой чувствительности к отклонениям от нормальности, особенно в области хвостов распределения. Впоследствии были разработаны модификации теста, в том числе для работы с цензурированными данными и для проверки многомерной нормальности.
¶Суть метода
Тест Шапиро-Уилка проверяет нулевую гипотезу \(H_0\): выборка взята из нормально распределённой генеральной совокупности. Альтернативная гипотеза \(H_1\): распределение не является нормальным. Статистика теста \(W\) вычисляется по формуле:
\[ W = \frac{(\sum_{i=1}^{n} a_i x_{(i)})^2}{\sum_{i=1}^{n} (x_i - \bar{x})^2} \]
где:
- \(x_{(i)}\) — i-я порядковая статистика (элемент выборки, отсортированный по возрастанию);
- \(a_i\) — весовые коэффициенты, зависящие от объёма выборки \(n\) и математического ожидания порядковых статистик стандартного нормального распределения;
- \(\bar{x}\) — выборочное среднее.
Значение \(W\) лежит в интервале от 0 до 1. Чем ближе \(W\) к 1, тем меньше оснований отвергнуть нулевую гипотезу о нормальности. Малое значение \(W\) указывает на отклонение от нормальности. Для каждого объёма выборки \(n\) существуют таблицы критических значений \(W\), или же p-значение вычисляется с помощью аппроксимаций.
¶Принцип работы
Тест основан на сравнении двух оценок дисперсии:
- Оценка на основе порядковых статистик (числитель): использует взвешенную сумму порядковых статистик, где веса \(a_i\) подобраны так, чтобы при нормальном распределении эта сумма была пропорциональна выборочному стандартному отклонению. Коэффициенты \(a_i\) являются оптимальными для нормального распределения и вычисляются из ковариационной матрицы порядковых статистик.
- Обычная выборочная дисперсия (знаменатель): сумма квадратов отклонений от среднего.
Если выборка нормальна, обе оценки дисперсии близки, и \(W\) близок к 1. Если распределение отличается от нормального (например, имеет асимметрию или толстые хвосты), отношение становится меньше 1.
¶Применение
Тест Шапиро-Уилка широко используется в различных областях, где требуется проверка предположения о нормальности данных перед применением параметрических статистических методов:
- Медицина и биология: анализ клинических данных, результатов лабораторных экспериментов, генетических исследований.
- Психология и социология: обработка данных опросов, тестов, психометрических шкал.
- Экономика и финансы: анализ доходности активов, проверка нормальности остатков регрессионных моделей.
- Инженерия и контроль качества: оценка распределения погрешностей измерений, анализ технологических процессов.
- Экология: анализ данных мониторинга окружающей среды.
Тест часто применяется в качестве предварительного этапа перед использованием t-критерия Стьюдента, дисперсионного анализа (ANOVA), линейной регрессии и других методов, чувствительных к нарушению нормальности.
¶Ограничения и особенности
¶Размер выборки
Тест Шапиро-Уилка изначально разработан для выборок объёмом от 3 до 50 наблюдений. Для больших выборок (более 50–100) его мощность может снижаться, и он становится слишком чувствительным к незначительным отклонениям от нормальности, которые не имеют практического значения. Для больших выборок чаще используют критерий Андерсона-Дарлинга или визуальные методы (Q-Q plot).
¶Чувствительность
Тест обладает высокой мощностью против широкого спектра альтернатив: асимметричных распределений, распределений с толстыми или тонкими хвостами, а также смесей распределений. Однако он может быть менее чувствителен к отклонениям в центральной части распределения при наличии выбросов.
¶Вычислительная сложность
Расчёт весовых коэффициентов \(a_i\) требует обращения ковариационной матрицы порядковых статистик, что для больших \(n\) может быть вычислительно затратным. В современных статистических пакетах (R, Python, SPSS, SAS) используются аппроксимации и предварительно рассчитанные таблицы.
¶Необходимость случайной выборки
Тест предполагает, что данные представляют собой простую случайную выборку из генеральной совокупности. Нарушение этого условия (например, зависимость наблюдений) может привести к некорректным результатам.
¶Пример использования
Пусть имеется выборка объёмом \(n=10\): [2.1, 3.4, 1.8, 2.9, 3.1, 2.5, 2.7, 3.0, 2.2, 2.8]. Для проверки нормальности вычисляется статистика \(W\). В статистическом пакете R это делается командой shapiro.test(x). Результат: \(W = 0.975\), p-value = 0.934. Поскольку p-value > 0.05, нулевая гипотеза о нормальности не отвергается.
¶Альтернативные критерии нормальности
- Критерий Колмогорова-Смирнова (с поправкой Лиллиефорса): менее мощный для малых выборок, но применим для любых размеров.
- Критерий Андерсона-Дарлинга: более чувствителен к отклонениям в хвостах распределения, особенно для больших выборок.
- Критерий Харке-Бера: основан на асимметрии и эксцессе, прост в вычислении, но менее мощен для малых выборок.
- Визуальные методы: Q-Q plot (график квантилей), гистограмма с наложенной кривой нормального распределения.
¶Интересные факты
- Тест Шапиро-Уилка часто называют «W-тестом» по обозначению статистики.
- В 1968 году Шапиро и Уилк опубликовали расширение теста для цензурированных выборок.
- Несмотря на возраст, тест остаётся одним из самых популярных в статистической практике, особенно в биомедицинских исследованиях.
- В некоторых пакетах (например, в SPSS) тест Шапиро-Уилка автоматически применяется для выборок объёмом до 50, а для больших — используется критерий Колмогорова-Смирнова.
¶Источники
- Shapiro, S. S., & Wilk, M. B. (1965). An analysis of variance test for normality (complete samples). Biometrika, 52(3/4), 591–611.
- Royston, P. (1982). An extension of Shapiro and Wilk's W test for normality to large samples. Applied Statistics, 31(2), 115–124.
- Razali, N. M., & Wah, Y. B. (2011). Power comparisons of Shapiro-Wilk, Kolmogorov-Smirnov, Lilliefors and Anderson-Darling tests. Journal of Statistical Modeling and Analytics, 2(1), 21–33.
- Thode, H. C. (2002). Testing for Normality. Marcel Dekker.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →


