Открыть сервис

P-value

P-value (от англ. probability value, значение вероятности; также p-уровень значимости, достигнутый уровень значимости) — это статистическая мера, используемая при проверке гипотез. Она представляет собой вероятность получить наблюдаемое или более экстремальное значение тестовой статистики при условии, что нулевая гипотеза верна. Иными словами, p-value показывает, насколько полученные данные согласуются с нулевой гипотезой: чем меньше p-value, тем сильнее данные противоречат нулевой гипотезе. P-value является одним из ключевых понятий в математической статистике, широко применяется в научных исследованиях, медицине, экономике и других областях, где требуется оценить достоверность результатов.

История

Концепция, лежащая в основе p-value, восходит к работам английского статистика Рональда Фишера в 1920-х годах. Фишер ввёл понятие «уровень значимости» и предложил использовать p-value как меру доказательности против нулевой гипотезы. В своей книге «Статистические методы для исследователей» (1925) он описал процедуру, при которой исследователь вычисляет p-value и, если оно меньше некоторого порога (например, 0,05), может отвергнуть нулевую гипотезу. Фишер не рассматривал p-value как строгий критерий принятия решений, а скорее как индикатор, указывающий на необходимость дальнейшего изучения.

Позднее, в 1930-х годах, Ежи Нейман и Эгон Пирсон разработали альтернативный подход — теорию проверки гипотез, основанную на фиксированном уровне значимости (α) и ошибках первого и второго рода. В их схеме p-value не используется напрямую; вместо этого исследователь заранее выбирает порог α и отвергает нулевую гипотезу, если тестовая статистика попадает в критическую область. Тем не менее, на практике подход Фишера (с p-value) и подход Неймана — Пирсона (с фиксированным α) часто смешиваются, и p-value интерпретируется как «достигнутый уровень значимости».

В последние десятилетия p-value подвергается критике за неправильное использование и интерпретацию. В 2016 году Американская статистическая ассоциация (ASA) опубликовала заявление, в котором предупредила о распространённых ошибках и дала рекомендации по корректному применению p-value.

Определение и формальное описание

Пусть \(H_0\) — нулевая гипотеза, а \(T\) — некоторая тестовая статистика, распределение которой известно (или аппроксимировано) при условии истинности \(H_0\). Пусть \(t_{\text{набл}}\) — наблюдаемое значение статистики, полученное по выборке. Тогда p-value определяется как:

\[ p = P(T \geq t_{\text{набл}} \mid H_0) \]

для одностороннего теста (правостороннего). Для левостороннего теста используется неравенство \(P(T \leq t_{\text{набл}} \mid H_0)\), а для двустороннего — удвоенная вероятность «хвоста» в зависимости от симметрии распределения.

Таким образом, p-value — это условная вероятность, а не вероятность того, что нулевая гипотеза верна. Ошибочное отождествление p-value с вероятностью истинности \(H_0\) является одной из самых распространённых ошибок.

Интерпретация и пороговые значения

Традиционно в научной практике используется порог \(\alpha = 0{,}05\). Если p-value < 0,05, результат считается «статистически значимым», и нулевая гипотеза отвергается. Однако такое деление условно: Фишер предлагал рассматривать p-value как непрерывную меру, а не дихотомический критерий. В разных областях применяются разные пороги: в физике элементарных частиц — \(\alpha = 3 \times 10^{-7}\) (соответствует «пяти сигмам»), в медицине — часто 0,05 или 0,01.

Важно понимать, что p-value не является мерой величины эффекта или практической значимости результата. Даже очень маленькое p-value может быть получено при большом объёме выборки, даже если эффект ничтожно мал.

Критика и ограничения

P-value подвергается критике по нескольким причинам:

  • Неверная интерпретация. Многие исследователи ошибочно полагают, что p-value — это вероятность того, что нулевая гипотеза верна, или что \(1-p\) — это вероятность того, что верна альтернативная гипотеза.
  • Зависимость от объёма выборки. При очень больших выборках p-value может быть сколь угодно малым даже для тривиальных эффектов, а при малых — не достигать значимости для реальных эффектов.
  • Проблема множественных сравнений. Если проверяется много гипотез одновременно, вероятность получить хотя бы одно p-value < 0,05 возрастает, что требует коррекции (например, поправка Бонферрони).
  • Склонность к «p-хакингу» (p-hacking) — манипуляции с данными и анализом для получения значимых p-value (например, удаление выбросов, добавление переменных, выбор статистического теста «задним числом»).
  • Дихотомизация. Сведение непрерывной меры к бинарному решению (значимо/незначимо) ведёт к потере информации и искажению выводов.

В ответ на эти проблемы ряд научных журналов (например, Basic and Applied Social Psychology) ввёл запрет на использование p-value, требуя вместо этого представления доверительных интервалов и величин эффекта. Другие издания рекомендуют использовать p-value в сочетании с другими метриками.

Альтернативы и дополнения

В современной статистике предлагаются альтернативные подходы:

  • Байесовские методы. Вместо p-value вычисляется байесовский фактор или апостериорная вероятность гипотезы.
  • Доверительные интервалы. Показывают диапазон, в котором с заданной вероятностью находится истинное значение параметра.
  • Величина эффекта (effect size). Мера практической значимости результата, не зависящая от объёма выборки (например, d Коэна, коэффициент корреляции).
  • Предрегистрация исследований. Публичная регистрация плана анализа до сбора данных, что снижает риск p-хакинга.

Примеры использования

  1. Медицина. В клинических испытаниях p-value используется для сравнения эффективности нового препарата с плацебо. Если p-value < 0,05, считается, что различие статистически значимо.
  2. Экономика. При оценке влияния экономической политики на ВВП p-value проверяет гипотезу о нулевом эффекте.
  3. Генетика. В исследованиях ассоциаций (GWAS) p-value для тысяч генетических маркеров корректируется с учётом множественных сравнений, чтобы избежать ложных открытий.

Интересные факты

  • Термин «p-value» ввёл в обиход Рональд Фишер, хотя сам он предпочитал обозначение «P».
  • В 2015 году журнал Science опубликовал статью, в которой утверждалось, что более 50% психологических исследований, опубликованных в ведущих журналах, могут быть невоспроизводимы — частично из-за неправильного использования p-value.
  • В 2019 году группа статистиков предложила заменить p-value на «s-value» (surprisal value), которая выражает удивление от данных в битах информации.

Источники

  • Fisher, R. A. (1925). Statistical Methods for Research Workers.
  • Neyman, J., & Pearson, E. S. (1933). «On the problem of the most efficient tests of statistical hypotheses».
  • Wasserstein, R. L., & Lazar, N. A. (2016). «The ASA Statement on p-Values: Context, Process, and Purpose». The American Statistician.
  • Goodman, S. (2008). «A dirty dozen: twelve p-value misconceptions». Seminars in Hematology.
  • Ioannidis, J. P. A. (2005). «Why most published research findings are false». PLoS Medicine.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →