P-хаккинг
P-хаккинг (от англ. p-hacking, также p-value hacking, data dredging, data fishing — «ловля данных», «прочёсывание данных») — это статистическая практика, заключающаяся в манипуляции данными или методами их анализа с целью получения статистически значимого p-значения (p-value), обычно ниже порога 0,05. P-хаккинг является формой некорректного научного поведения, ведущей к завышению ложноположительных результатов и подрыву воспроизводимости исследований.
История
Термин «p-хаккинг» вошёл в широкий научный обиход в 2010-х годах, хотя сама практика существовала задолго до этого. В 2011 году вышла статья психолога Джозефа Симмонса и его коллег «False-Positive Psychology», в которой авторы экспериментально показали, как с помощью p-хаккинга можно получить статистически значимые результаты из бессмысленных данных (например, показать, что прослушивание песни «When I’m Sixty-Four» группы The Beatles якобы омолаживает испытуемых). Эта работа привлекла широкое внимание к проблеме.
В 2015 году журнал Science опубликовал масштабный проект «Reproducibility Project» под руководством Брайана Носека, в ходе которого было воспроизведено лишь 39 из 100 психологических экспериментов. Одной из главных причин низкой воспроизводимости назвали p-хаккинг и другие сомнительные исследовательские практики (questionable research practices, QRPs).
Механизм и методы
P-хаккинг основан на эксплуатации статистической неопределённости. Стандартный порог значимости (p < 0,05) означает, что вероятность ошибочно отвергнуть нулевую гипотезу (ложноположительный результат) составляет 5% при однократной проверке. Однако при многократных проверках или манипуляциях эта вероятность резко возрастает. Основные методы p-хаккинга включают:
Выборочное включение или исключение данных
Исследователь удаляет «выбросы» или отдельные наблюдения, которые мешают достижению значимости, без объективных критериев. Например, если после удаления данных трёх испытуемых p-значение падает ниже 0,05, результат объявляется значимым.
Добавление дополнительных испытуемых
Сбор данных продолжается до тех пор, пока не будет достигнут желаемый результат. Это нарушает принцип фиксированного объёма выборки, заложенный в расчёт мощности.
Множественные сравнения без коррекции
Проверяется множество гипотез (например, корреляции между десятками переменных), но отчитываются только о тех, где p < 0,05. Без поправки на множественные сравнения (например, поправки Бонферрони или FDR) вероятность найти хотя бы один ложноположительный результат при 20 проверках превышает 64%.
Изменение критериев включения
Исследователь меняет определение переменных или подгрупп после анализа данных. Например, если корреляция не значима для всей выборки, он делит её по полу и находит значимость только для женщин.
Выбор статистического теста
Из нескольких возможных тестов (параметрический vs. непараметрический, t-критерий vs. U-критерий Манна — Уитни) выбирается тот, который даёт наименьшее p-значение.
Последствия
P-хаккинг ведёт к нескольким негативным эффектам в науке:
- Инфляция ложноположительных результатов: публикуются «открытия», которые на самом деле являются случайными флуктуациями. Это особенно характерно для областей с малыми выборками, таких как нейронаука, психология, биомедицина.
- Кризис воспроизводимости: многие результаты не удаётся воспроизвести в независимых лабораториях. По разным оценкам, от 50% до 80% опубликованных результатов в некоторых дисциплинах могут быть ложными.
- Искажение мета-анализов: если в литературе преобладают ложноположительные результаты, мета-анализы (обобщающие данные множества исследований) дают завышенные оценки эффектов.
- Потеря доверия: общественность и спонсоры начинают сомневаться в надёжности научных выводов, что подрывает финансирование и авторитет науки.
Примеры
Психология и социальные науки
В 2011 году команда Дарила Бема опубликовала статью, якобы доказывающую существование «прекогниции» (способности предвидеть будущее). Анализ показал, что результаты были получены с помощью p-хаккинга: из множества проверок лишь несколько дали значимые p-значения, и именно они были представлены как доказательство.
Медицина
В 2013 году исследователи из компании Amgen сообщили, что смогли воспроизвести лишь 6 из 53 «знаковых» онкологических исследований. Причиной называли, в том числе, p-хаккинг и неполное описание методов.
Экономика
В 2017 году экономист Джон Лист и его коллеги проанализировали 1000 статей из ведущих экономических журналов и обнаружили, что в 40% случаев p-значения концентрируются сразу под порогом 0,05, что указывает на возможный p-хаккинг.
Борьба с p-хаккингом
Для снижения распространённости p-хаккинга научное сообщество разработало ряд мер:
Пререгистрация исследований
Исследователь заранее публикует план анализа (гипотезы, размер выборки, критерии исключения, статистические тесты) в открытом реестре (например, ClinicalTrials.gov, OSF). Отклонение от плана требует объяснения. В России пререгистрация поощряется, но пока не является обязательной для большинства журналов.
Открытые данные и код
Предоставление сырых данных и скриптов анализа позволяет независимым исследователям проверить результаты. В 2020 году Российский фонд фундаментальных исследований (РФФИ) начал рекомендовать грантополучателям публиковать данные в открытых репозиториях.
Использование порогов значимости
Некоторые журналы (например, Basic and Applied Social Psychology) полностью запретили использование p-значений, требуя вместо этого отчёта о величине эффекта и доверительных интервалах. Другие (например, Nature Human Behaviour) ввели более строгий порог (p < 0,005).
Мета-анализ и байесовские методы
Мета-анализы позволяют оценить совокупный эффект по множеству исследований, снижая влияние отдельных p-хакнутых результатов. Байесовская статистика, в отличие от частотной, не опирается на фиксированный порог значимости и требует априорных вероятностей, что делает её менее подверженной p-хаккингу.
Образование и этика
Вузы и научные организации включают в курсы статистики разделы о сомнительных практиках. В 2018 году Американская статистическая ассоциация выпустила заявление, предостерегающее от использования p-значения как единственного критерия истинности.
Критика концепции
Некоторые исследователи отмечают, что термин «p-хаккинг» может стигматизировать исследователей, которые применяют законные методы разведочного анализа данных. Разведочный анализ (exploratory data analysis) — это нормальная часть научного процесса, но он должен быть чётко отделён от подтверждающего анализа (confirmatory analysis). Проблема возникает, когда разведочные результаты преподносятся как подтверждающие без указания на это. Кроме того, чрезмерное внимание к p-хаккингу может отвлекать от более фундаментальных проблем, таких как плохая теория, малые выборки и публикационное смещение (склонность журналов публиковать только положительные результаты).
См. также
- Статистическая значимость
- P-значение
- Кризис воспроизводимости
- Множественные сравнения
- Харкеринг
- Эффект файлового ящика
Источники
- Simmons J. P., Nelson L. D., Simonsohn U. False-positive psychology: Undisclosed flexibility in data collection and analysis allows presenting anything as significant // Psychological Science. — 2011. — Vol. 22, № 11. — P. 1359–1366.
- Open Science Collaboration. Estimating the reproducibility of psychological science // Science. — 2015. — Vol. 349, № 6251. — P. aac4716.
- Head M. L., Holman L., Lanfear R., Kahn A. T., Jennions M. D. The extent and consequences of p-hacking in science // PLoS Biology. — 2015. — Vol. 13, № 3. — P. e1002106.
- Wasserstein R. L., Lazar N. A. The ASA statement on p-values: context, process, and purpose // The American Statistician. — 2016. — Vol. 70, № 2. — P. 129–133.
- Nosek B. A., Ebersole C. R., DeHaven A. C., Mellor D. T. The preregistration revolution // Proceedings of the National Academy of Sciences. — 2018. — Vol. 115, № 11. — P. 2600–2606.
- Российский фонд фундаментальных исследований. Рекомендации по управлению данными исследований. — 2020.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →