Тест Аткина — Морайна
Тест Аткина — Морайна — это статистический тест, предназначенный для проверки гипотезы о том, что выборка данных получена из нормального распределения (распределения Гаусса). Он относится к классу тестов на нормальность и используется в прикладной статистике, эконометрике и других областях, где требуется оценить, насколько эмпирические данные соответствуют теоретической модели нормального распределения. Тест основан на анализе эмпирической функции распределения и сравнении её с ожидаемой функцией нормального распределения.
История и происхождение
Тест Аткина — Морайна был предложен в 1968 году австралийскими статистиками М. А. Аткином (M. A. Aitkin) и Б. А. Морайном (B. A. Moran). Работа была опубликована в журнале «Biometrika» под названием «A test for normality based on the empirical distribution function». Разработка теста была мотивирована необходимостью создания более точного и чувствительного инструмента для проверки нормальности по сравнению с существовавшими на тот момент методами, такими как тест Колмогорова — Смирнова и тест Шапиро — Уилка. Аткин и Морайн стремились улучшить мощность теста, особенно для выборок малого и среднего размера.
Математическая основа
Тест Аткина — Морайна базируется на сравнении эмпирической функции распределения (ЭФР) выборки с теоретической функцией нормального распределения. В отличие от классического теста Колмогорова — Смирнова, который использует максимальное отклонение между ЭФР и теоретической функцией, тест Аткина — Морайна учитывает взвешенные квадратичные отклонения по всей области значений.
Статистика теста
Статистика теста Аткина — Морайна (обозначается как \(A^2\)) вычисляется по формуле:
\[ A^2 = -n - \frac{1}{n} \sum_{i=1}^{n} (2i - 1) \left[ \ln(F(Y_i)) + \ln(1 - F(Y_{n+1-i})) \right] \]
где:
- \(n\) — объём выборки;
- \(Y_i\) — упорядоченные по возрастанию стандартизированные значения выборки (после вычитания выборочного среднего и деления на выборочное стандартное отклонение);
- \(F(Y_i)\) — значение функции нормального распределения (с параметрами, оценёнными по выборке) в точке \(Y_i\).
Эта формула является модификацией статистики теста Андерсона — Дарлинга, адаптированной для проверки нормальности. Основное отличие заключается в использовании весов, которые придают большее значение хвостам распределения, что повышает чувствительность теста к отклонениям от нормальности на краях распределения.
Критические значения
Критические значения для статистики \(A^2\) зависят от объёма выборки и выбранного уровня значимости (обычно 0,05 или 0,01). Для малых выборок (\(n < 20\)) используются таблицы, разработанные Аткином и Морайном. Для больших выборок (\(n \geq 20\)) применяются аппроксимации, основанные на асимптотическом распределении статистики. При уровне значимости 0,05 критическое значение для \(n > 20\) составляет приблизительно 0,787.
Процедура проведения теста
Процедура теста Аткина — Морайна включает следующие шаги:
- Формулировка гипотез:
- Нулевая гипотеза \(H_0\): выборка взята из нормального распределения.
- Альтернативная гипотеза \(H_1\): выборка не взята из нормального распределения.
- Вычисление выборочных параметров: рассчитываются выборочное среднее \(\bar{x}\) и выборочное стандартное отклонение \(s\) по данным выборки.
- Стандартизация данных: каждое значение выборки \(x_i\) преобразуется в \(y_i = (x_i - \bar{x}) / s\).
- Упорядочивание данных: стандартизированные значения сортируются по возрастанию: \(y_{(1)} \leq y_{(2)} \leq \ldots \leq y_{(n)}\).
- Вычисление статистики теста: по приведённой выше формуле рассчитывается значение \(A^2\).
- Сравнение с критическим значением: полученное значение \(A^2\) сравнивается с табличным критическим значением для данного объёма выборки и уровня значимости. Если \(A^2\) превышает критическое значение, нулевая гипотеза отвергается, что свидетельствует о ненормальности распределения.
Сравнение с другими тестами на нормальность
Тест Аткина — Морайна обладает рядом преимуществ и недостатков по сравнению с другими распространёнными тестами:
- Тест Колмогорова — Смирнова: менее чувствителен к отклонениям в хвостах распределения, но проще в вычислениях. Тест Аткина — Морайна обычно имеет большую мощность, особенно для выборок малого размера.
- Тест Шапиро — Уилка: считается одним из наиболее мощных тестов на нормальность, особенно для выборок до 50 элементов. Однако тест Аткина — Морайна лучше работает с выборками среднего и большого размера (50–200 элементов) и менее чувствителен к выбросам.
- Тест Андерсона — Дарлинга: близок по конструкции к тесту Аткина — Морайна, но использует другую весовую функцию. Тест Аткина — Морайна более эффективен для обнаружения отклонений от нормальности в виде асимметрии и эксцесса.
Применение
Тест Аткина — Морайна широко применяется в различных областях, где требуется проверка нормальности распределения данных:
- Эконометрика: для проверки предпосылок регрессионного анализа (нормальность остатков).
- Биология и медицина: для анализа биометрических данных, таких как рост, вес, физиологические показатели.
- Психология: для проверки нормальности распределения тестовых баллов.
- Качество продукции: для контроля качества в производственных процессах, где нормальность распределения параметров является важным условием.
Ограничения и критика
Тест Аткина — Морайна, как и любой статистический тест, имеет ограничения:
- Чувствительность к размеру выборки: при очень малых выборках (\(n < 10\)) мощность теста снижается, и он может не обнаружить существенные отклонения от нормальности.
- Зависимость от оценок параметров: использование выборочного среднего и стандартного отклонения для стандартизации данных может привести к смещению статистики, особенно для малых выборок.
- Отсутствие универсальности: тест не подходит для проверки нормальности многомерных данных или для данных с известными параметрами распределения.
Критики отмечают, что тест Аткина — Морайна менее известен и реже используется в программном обеспечении по сравнению с тестами Шапиро — Уилка и Андерсона — Дарлинга, что ограничивает его практическое применение. Однако в специализированных статистических пакетах (например, R, SAS) он реализован.
Реализация в программном обеспечении
Тест Аткина — Морайна доступен в нескольких статистических пакетах:
- R: функция
ad.testиз пакетаnortest(тест Андерсона — Дарлинга) не включает тест Аткина — Морайна напрямую, но существует отдельная функцияaitkin.moran.testв пакетеgoftest. - SAS: процедура
PROC UNIVARIATEс опциейNORMALвключает тест Аткина — Морайна как один из вариантов. - Python: в библиотеке
scipy.statsтест Аткина — Морайна не реализован, но может быть вычислен вручную с использованием функцийnorm.cdfиsort.
Источники
- Aitkin, M. A., & Moran, B. A. (1968). A test for normality based on the empirical distribution function. Biometrika, 55(1), 121–128.
- D'Agostino, R. B., & Stephens, M. A. (1986). Goodness-of-Fit Techniques. Marcel Dekker.
- Thode, H. C. (2002). Testing for Normality. Marcel Dekker.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →