P-значение
P-значение (p-value, от англ. probability value — «значение вероятности») — это статистическая мера, используемая в проверке статистических гипотез. Она представляет собой вероятность получить наблюдаемые или более экстремальные результаты при условии, что нулевая гипотеза (H₀) верна. P-значение не является вероятностью того, что нулевая гипотеза истинна, а служит инструментом для оценки степени несовместимости данных с нулевой гипотезой. Чем меньше p-значение, тем сильнее статистические данные противоречат нулевой гипотезе.
История возникновения
Концепция p-значения восходит к работам английского статистика и биолога Рональда Фишера (Ronald Fisher) в 1920-х годах. Фишер предложил использовать p-значение как меру доказательства против нулевой гипотезы, при этом он рекомендовал пороговое значение 0,05 как удобный ориентир для «статистической значимости». Однако Фишер не рассматривал p-значение как строгий критерий принятия решений, а скорее как индикатор, требующий дальнейшего анализа.
В 1930-х годах статистики Ежи Нейман (Jerzy Neyman) и Эгон Пирсон (Egon Pearson) разработали альтернативный подход — проверку гипотез на основе фиксированного уровня значимости (α) и мощности критерия. В их системе p-значение не использовалось напрямую; вместо этого исследователь заранее устанавливал α (часто 0,05 или 0,01) и сравнивал тестовую статистику с критическим значением. Впоследствии эти два подхода — фишеровский и неймановско-пирсоновский — были объединены в современную практику, где p-значение сравнивается с заранее выбранным α.
Определение и математическая основа
Пусть H₀ — нулевая гипотеза, а T — тестовая статистика, вычисленная на основе выборочных данных. Пусть t — наблюдаемое значение этой статистики. Тогда p-значение определяется как:
- Для правостороннего теста: p = P(T ≥ t | H₀)
- Для левостороннего теста: p = P(T ≤ t | H₀)
- Для двустороннего теста: p = 2 * min(P(T ≥ t | H₀), P(T ≤ t | H₀))
Формально p-значение — это вероятность при нулевой гипотезе получить значение тестовой статистики, равное или более экстремальное, чем наблюдаемое. Оно зависит от формы распределения тестовой статистики при H₀ (например, нормального, t-распределения Стьюдента, хи-квадрат, F-распределения).
Интерпретация и использование
В классической процедуре проверки гипотез исследователь заранее выбирает уровень значимости α (обычно 0,05, 0,01 или 0,001). Если p-значение меньше α, то результат считается статистически значимым, и нулевая гипотеза отвергается в пользу альтернативной. Если p-значение больше или равно α, то нулевая гипотеза не отвергается (но не принимается как истинная).
Распространённые пороги:
- p < 0,05 — «статистически значимый» результат;
- p < 0,01 — «высоко значимый»;
- p < 0,001 — «очень высоко значимый».
Однако эти пороги являются условными и не имеют строгого математического обоснования. Фишер выбрал 0,05 как удобное значение, исходя из практики сельскохозяйственных опытов.
Распространённые заблуждения
P-значение часто неправильно интерпретируется как:
- Вероятность того, что нулевая гипотеза истинна (на самом деле это условная вероятность при H₀);
- Вероятность того, что альтернативная гипотеза ложна;
- Мера размера эффекта или практической значимости результата;
- Вероятность того, что результат был получен случайно.
Например, p = 0,03 не означает, что вероятность ошибки первого рода (отвергнуть истинную H₀) равна 3%. Ошибка первого рода фиксируется уровнем α, а p-значение — это наблюдаемая мера несовместимости данных с H₀.
Критика и ограничения
В 2010-х годах развернулась широкая дискуссия о некорректном использовании p-значений в научных публикациях, особенно в психологии, медицине и биологии. Основные проблемы:
- p-хакинг (p-hacking): манипуляции с данными или анализом (например, исключение выбросов, выбор подходящей тестовой статистики, добавление наблюдений) для получения p < 0,05.
- Публикационное смещение (publication bias): журналы чаще публикуют результаты с p < 0,05, что искажает общую картину доказательств.
- Дискретизация по порогу: жёсткое разделение на «значимые» и «незначимые» результаты приводит к потере информации и переоценке эффектов.
- Неучёт множественных сравнений: при одновременной проверке многих гипотез растёт вероятность ложных открытий.
В 2016 году Американская статистическая ассоциация (ASA) опубликовала заявление, в котором предупредила о недопустимости использования p-значения как единственного критерия научной значимости и рекомендовала дополнять его доверительными интервалами, размерами эффекта и байесовскими подходами.
Альтернативы и дополнения
В ответ на критику были предложены альтернативные методы:
- Доверительные интервалы: показывают диапазон правдоподобных значений параметра, а не только бинарное решение.
- Байесовские факторы (Bayes factors): сравнивают предсказательную силу нулевой и альтернативной гипотез.
- Размер эффекта (effect size): стандартизированная мера величины различий или связи (например, d Коэна, r Пирсона).
- Методы коррекции множественных сравнений: поправка Бонферрони, метод Холма, контроль ложного уровня открытий (FDR).
- Предрегистрация (preregistration): фиксация плана анализа до сбора данных, что снижает риск p-хакинга.
Применение в различных областях
P-значение широко используется в:
- Медицине: для оценки эффективности лекарств (например, в рандомизированных контролируемых испытаниях);
- Психологии: для проверки гипотез о различиях между группами (например, в экспериментах с когнитивными тестами);
- Экономике: для анализа временных рядов и регрессионных моделей;
- Биологии: для сравнения экспрессии генов или частот аллелей;
- Социологии: для анализа опросов и корреляций.
Современное состояние
Несмотря на критику, p-значение остаётся одним из самых распространённых инструментов статистического вывода. Многие научные журналы и организации (например, Nature, Science) требуют от авторов предоставлять полные p-значения (а не только «p < 0,05»), а также размеры эффектов и доверительные интервалы. В 2019 году в журнале The American Statistician вышла специальная статья, призывающая отказаться от использования термина «статистическая значимость» и порога 0,05, однако полного отказа от p-значений не произошло.
Источники
- Fisher, R. A. (1925). Statistical Methods for Research Workers. Edinburgh: Oliver and Boyd.
- Neyman, J., & Pearson, E. S. (1933). On the problem of the most efficient tests of statistical hypotheses. Philosophical Transactions of the Royal Society of London. Series A, 231, 289–337.
- Wasserstein, R. L., & Lazar, N. A. (2016). The ASA Statement on p-Values: Context, Process, and Purpose. The American Statistician, 70(2), 129–133.
- Goodman, S. N. (2008). A dirty dozen: twelve p-value misconceptions. Seminars in Hematology, 45(3), 135–140.
- Ioannidis, J. P. A. (2005). Why most published research findings are false. PLoS Medicine, 2(8), e124.
- Gelman, A., & Stern, H. (2006). The difference between “significant” and “not significant” is not itself statistically significant. The American Statistician, 60(4), 328–331.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →