P-value
P-value (от англ. probability value, значение вероятности; также p-уровень значимости, достигнутый уровень значимости) — это статистическая мера, используемая при проверке гипотез. Она представляет собой вероятность получить наблюдаемое или более экстремальное значение тестовой статистики при условии, что нулевая гипотеза верна. Иными словами, p-value показывает, насколько полученные данные согласуются с нулевой гипотезой: чем меньше p-value, тем сильнее данные противоречат нулевой гипотезе. P-value является одним из ключевых понятий в математической статистике, широко применяется в научных исследованиях, медицине, экономике и других областях, где требуется оценить достоверность результатов.
История
Концепция, лежащая в основе p-value, восходит к работам английского статистика Рональда Фишера в 1920-х годах. Фишер ввёл понятие «уровень значимости» и предложил использовать p-value как меру доказательности против нулевой гипотезы. В своей книге «Статистические методы для исследователей» (1925) он описал процедуру, при которой исследователь вычисляет p-value и, если оно меньше некоторого порога (например, 0,05), может отвергнуть нулевую гипотезу. Фишер не рассматривал p-value как строгий критерий принятия решений, а скорее как индикатор, указывающий на необходимость дальнейшего изучения.
Позднее, в 1930-х годах, Ежи Нейман и Эгон Пирсон разработали альтернативный подход — теорию проверки гипотез, основанную на фиксированном уровне значимости (α) и ошибках первого и второго рода. В их схеме p-value не используется напрямую; вместо этого исследователь заранее выбирает порог α и отвергает нулевую гипотезу, если тестовая статистика попадает в критическую область. Тем не менее, на практике подход Фишера (с p-value) и подход Неймана — Пирсона (с фиксированным α) часто смешиваются, и p-value интерпретируется как «достигнутый уровень значимости».
В последние десятилетия p-value подвергается критике за неправильное использование и интерпретацию. В 2016 году Американская статистическая ассоциация (ASA) опубликовала заявление, в котором предупредила о распространённых ошибках и дала рекомендации по корректному применению p-value.
Определение и формальное описание
Пусть \(H_0\) — нулевая гипотеза, а \(T\) — некоторая тестовая статистика, распределение которой известно (или аппроксимировано) при условии истинности \(H_0\). Пусть \(t_{\text{набл}}\) — наблюдаемое значение статистики, полученное по выборке. Тогда p-value определяется как:
\[ p = P(T \geq t_{\text{набл}} \mid H_0) \]
для одностороннего теста (правостороннего). Для левостороннего теста используется неравенство \(P(T \leq t_{\text{набл}} \mid H_0)\), а для двустороннего — удвоенная вероятность «хвоста» в зависимости от симметрии распределения.
Таким образом, p-value — это условная вероятность, а не вероятность того, что нулевая гипотеза верна. Ошибочное отождествление p-value с вероятностью истинности \(H_0\) является одной из самых распространённых ошибок.
Интерпретация и пороговые значения
Традиционно в научной практике используется порог \(\alpha = 0{,}05\). Если p-value < 0,05, результат считается «статистически значимым», и нулевая гипотеза отвергается. Однако такое деление условно: Фишер предлагал рассматривать p-value как непрерывную меру, а не дихотомический критерий. В разных областях применяются разные пороги: в физике элементарных частиц — \(\alpha = 3 \times 10^{-7}\) (соответствует «пяти сигмам»), в медицине — часто 0,05 или 0,01.
Важно понимать, что p-value не является мерой величины эффекта или практической значимости результата. Даже очень маленькое p-value может быть получено при большом объёме выборки, даже если эффект ничтожно мал.
Критика и ограничения
P-value подвергается критике по нескольким причинам:
- Неверная интерпретация. Многие исследователи ошибочно полагают, что p-value — это вероятность того, что нулевая гипотеза верна, или что \(1-p\) — это вероятность того, что верна альтернативная гипотеза.
- Зависимость от объёма выборки. При очень больших выборках p-value может быть сколь угодно малым даже для тривиальных эффектов, а при малых — не достигать значимости для реальных эффектов.
- Проблема множественных сравнений. Если проверяется много гипотез одновременно, вероятность получить хотя бы одно p-value < 0,05 возрастает, что требует коррекции (например, поправка Бонферрони).
- Склонность к «p-хакингу» (p-hacking) — манипуляции с данными и анализом для получения значимых p-value (например, удаление выбросов, добавление переменных, выбор статистического теста «задним числом»).
- Дихотомизация. Сведение непрерывной меры к бинарному решению (значимо/незначимо) ведёт к потере информации и искажению выводов.
В ответ на эти проблемы ряд научных журналов (например, Basic and Applied Social Psychology) ввёл запрет на использование p-value, требуя вместо этого представления доверительных интервалов и величин эффекта. Другие издания рекомендуют использовать p-value в сочетании с другими метриками.
Альтернативы и дополнения
В современной статистике предлагаются альтернативные подходы:
- Байесовские методы. Вместо p-value вычисляется байесовский фактор или апостериорная вероятность гипотезы.
- Доверительные интервалы. Показывают диапазон, в котором с заданной вероятностью находится истинное значение параметра.
- Величина эффекта (effect size). Мера практической значимости результата, не зависящая от объёма выборки (например, d Коэна, коэффициент корреляции).
- Предрегистрация исследований. Публичная регистрация плана анализа до сбора данных, что снижает риск p-хакинга.
Примеры использования
- Медицина. В клинических испытаниях p-value используется для сравнения эффективности нового препарата с плацебо. Если p-value < 0,05, считается, что различие статистически значимо.
- Экономика. При оценке влияния экономической политики на ВВП p-value проверяет гипотезу о нулевом эффекте.
- Генетика. В исследованиях ассоциаций (GWAS) p-value для тысяч генетических маркеров корректируется с учётом множественных сравнений, чтобы избежать ложных открытий.
Интересные факты
- Термин «p-value» ввёл в обиход Рональд Фишер, хотя сам он предпочитал обозначение «P».
- В 2015 году журнал Science опубликовал статью, в которой утверждалось, что более 50% психологических исследований, опубликованных в ведущих журналах, могут быть невоспроизводимы — частично из-за неправильного использования p-value.
- В 2019 году группа статистиков предложила заменить p-value на «s-value» (surprisal value), которая выражает удивление от данных в битах информации.
Источники
- Fisher, R. A. (1925). Statistical Methods for Research Workers.
- Neyman, J., & Pearson, E. S. (1933). «On the problem of the most efficient tests of statistical hypotheses».
- Wasserstein, R. L., & Lazar, N. A. (2016). «The ASA Statement on p-Values: Context, Process, and Purpose». The American Statistician.
- Goodman, S. (2008). «A dirty dozen: twelve p-value misconceptions». Seminars in Hematology.
- Ioannidis, J. P. A. (2005). «Why most published research findings are false». PLoS Medicine.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →


