Поправка Бонферрони
Поправка Бонферрони (также известная как коррекция Бонферрони, поправка Бонферрони для множественных сравнений) — это статистический метод, используемый для снижения вероятности ошибки первого рода (ложноположительного результата) при одновременной проверке нескольких статистических гипотез. Суть метода заключается в том, что пороговый уровень значимости (α) делится на количество проводимых сравнений (m), что позволяет контролировать семейную вероятность ошибки (FWER) — вероятность совершить хотя бы одну ошибку первого рода во всей группе проверок.
История и происхождение
Метод назван в честь итальянского математика Карло Эмилио Бонферрони (1892–1960), который в 1936 году опубликовал работу, посвящённую неравенствам для вероятностей совместных событий. Само неравенство Бонферрони, лежащее в основе поправки, было известно и ранее, но именно Бонферрони систематизировал его применение в контексте множественных сравнений. В 1950-х и 1960-х годах метод начал активно использоваться в статистике, особенно в биологии, медицине и психологии, где часто возникает необходимость проверять большое количество гипотез одновременно (например, при сравнении нескольких групп пациентов или анализе множества генетических маркеров).
Суть метода
Основная идея
При проверке одной статистической гипотезы исследователь устанавливает уровень значимости α (обычно 0,05), который означает, что вероятность ошибочно отвергнуть верную нулевую гипотезу (ошибка первого рода) составляет 5 %. Если проверяется m гипотез, то вероятность совершить хотя бы одну ошибку первого рода среди всех проверок возрастает и может значительно превысить α. Например, при m = 10 и α = 0,05 вероятность хотя бы одной ложной значимости (при условии независимости гипотез) составляет примерно 1 − (1 − 0,05)¹⁰ ≈ 0,40, то есть 40 %.
Поправка Бонферрони решает эту проблему путём ужесточения критерия значимости для каждой отдельной гипотезы. Вместо α используется скорректированный порог α' = α / m. Гипотеза считается статистически значимой, если её p-значение меньше или равно α'.
Формальное определение
Пусть проверяется m нулевых гипотез H₀₁, H₀₂, ..., H₀ₘ. Для каждой гипотезы вычисляется p-значение p₁, p₂, ..., pₘ. Семейная вероятность ошибки (FWER) контролируется на уровне α, если для каждой гипотезы применяется порог α/m. Иными словами, гипотеза H₀ᵢ отвергается, если pᵢ ≤ α/m.
Пример
Предположим, исследователь проверяет 5 гипотез с уровнем α = 0,05. Согласно поправке Бонферрони, каждая гипотеза должна быть проверена на уровне α' = 0,05 / 5 = 0,01. Если p-значение для какой-либо гипотезы равно 0,02, то она не отвергается, так как 0,02 > 0,01.
Свойства и характеристики
Достоинства
- Простота применения: поправка не требует сложных вычислений, достаточно разделить α на количество сравнений.
- Универсальность: метод не накладывает никаких предположений о зависимости между гипотезами (например, они могут быть как независимыми, так и коррелированными).
- Консервативность: поправка строго контролирует FWER на заданном уровне, что делает её надёжным инструментом для предотвращения ложных открытий.
Недостатки
- Снижение статистической мощности: чем больше количество сравнений, тем строже становится порог, что приводит к уменьшению вероятности обнаружения истинных эффектов (ошибка второго рода). При большом m (например, в геномных исследованиях, где проверяются миллионы гипотез) поправка Бонферрони становится чрезмерно консервативной.
- Неприменимость для зависимых гипотез без оговорок: хотя метод работает при любых зависимостях, он может быть излишне строгим, если гипотезы сильно коррелированы, что дополнительно снижает мощность.
- Отсутствие гибкости: поправка не учитывает структуру данных или приоритетность гипотез, одинаково наказывая все сравнения.
Применение
Научные исследования
Поправка Бонферрони широко используется в различных областях науки, где требуется одновременная проверка множества гипотез:
- Медицина и фармакология: при сравнении эффективности нескольких методов лечения или доз препарата в клинических испытаниях. Например, если исследуется влияние нового лекарства на 10 различных показателей здоровья, поправка Бонферрони позволяет избежать ложных выводов о его эффективности.
- Генетика и биоинформатика: при анализе экспрессии тысяч генов или поиске ассоциаций между генетическими вариантами и заболеваниями (GWAS). В этих областях количество сравнений может достигать миллионов, поэтому поправка Бонферрони часто заменяется более мягкими методами (например, контролем FDR).
- Психология и социология: при анализе опросов с множеством вопросов или сравнении групп по нескольким параметрам.
- Экология: при изучении влияния множества факторов на видовое разнообразие или популяционные характеристики.
Примеры из практики
- Клиническое испытание: Исследователь сравнивает три группы пациентов (плацебо, низкая доза, высокая доза) по трём показателям (давление, уровень холестерина, частота пульса). Всего проводится 3 × 3 = 9 сравнений. При α = 0,05 порог значимости для каждого сравнения составит 0,05 / 9 ≈ 0,0056. Если p-значение для различия в давлении между плацебо и высокой дозой равно 0,003, то это различие признаётся статистически значимым.
- Генетическое исследование: В исследовании ассоциаций (GWAS) проверяется 1 000 000 однонуклеотидных полиморфизмов (SNP). При α = 0,05 порог для каждого SNP составит 5 × 10⁻⁸. Этот порог стал стандартом в генетике, хотя на практике часто используют более гибкие методы, такие как поправка Бенджамини-Хохберга.
Альтернативы и сравнение с другими методами
Поправка Бонферрони является одним из самых консервативных методов контроля FWER. Существуют и другие подходы:
- Метод Холма (Holm-Bonferroni): пошаговая процедура, которая менее консервативна, чем простая поправка Бонферрони, но также контролирует FWER. Гипотезы сортируются по возрастанию p-значений, и каждая проверяется на уровне α / (m − k + 1), где k — номер гипотезы в отсортированном списке.
- Метод Шидака (Šidák correction): даёт несколько более либеральный порог (α' = 1 − (1 − α)^(1/m)), но требует предположения о независимости гипотез.
- Метод Бенджамини-Хохберга (BH): контролирует не FWER, а долю ложных отклонений (FDR — false discovery rate). Этот метод менее строг и чаще применяется в исследованиях с большим числом гипотез, где допустимо небольшое количество ложных открытий.
- Метод Тьюки (Tukey's HSD): используется для попарных сравнений средних в дисперсионном анализе (ANOVA) и учитывает структуру данных.
Выбор метода зависит от целей исследования: если важно избежать любого ложного положительного результата (например, в клинических испытаниях), предпочтительна поправка Бонферрони или метод Холма. Если же допустимо некоторое количество ложных открытий (например, в разведочном анализе), лучше использовать методы контроля FDR.
Критика и ограничения
Поправка Бонферрони часто критикуется за чрезмерную консервативность, особенно в ситуациях с большим числом сравнений. Критики отмечают, что метод может привести к пропуску важных, но слабых эффектов, что снижает научную ценность исследования. Кроме того, поправка не учитывает корреляцию между гипотезами, что может быть неоптимальным в некоторых областях, например, в нейровизуализации, где тысячи пикселей изображения сильно взаимосвязаны.
В ответ на эту критику были разработаны более гибкие методы, такие как контроль FDR, которые позволяют балансировать между ошибками первого и второго рода. Тем не менее, поправка Бонферрони остаётся стандартным инструментом в ситуациях, где требуется строгий контроль над ложными положительными результатами, и её простота делает её популярной в учебных курсах по статистике.
Интересные факты
- Неравенство Бонферрони, на котором основана поправка, является частным случаем более общего неравенства Буля: P(∪ᵢ Aᵢ) ≤ ∑ᵢ P(Aᵢ). Для событий, связанных с ошибками первого рода, это неравенство даёт верхнюю границу вероятности хотя бы одной ошибки.
- В некоторых источниках поправку Бонферрони называют «коррекцией Бонферрони» или «методом Бонферрони», но правильный термин — «поправка», так как она корректирует порог значимости, а не сами данные.
- В генетических исследованиях порог 5 × 10⁻⁸, полученный с помощью поправки Бонферрони для 1 миллиона сравнений, стал общепринятым стандартом, несмотря на то, что реальное количество независимых тестов может быть меньше из-за корреляции между SNP.
Источники
- Bonferroni, C. E. (1936). Teoria statistica delle classi e calcolo delle probabilità. Pubblicazioni del R. Istituto Superiore di Scienze Economiche e Commerciali di Firenze, 8, 3–62.
- Dunn, O. J. (1961). Multiple comparisons among means. Journal of the American Statistical Association, 56(293), 52–64.
- Holm, S. (1979). A simple sequentially rejective multiple test procedure. Scandinavian Journal of Statistics, 6(2), 65–70.
- Benjamini, Y., & Hochberg, Y. (1995). Controlling the false discovery rate: a practical and powerful approach to multiple testing. Journal of the Royal Statistical Society: Series B (Methodological), 57(1), 289–300.
- Шитиков, В. К., & Розенберг, Г. С. (2013). Статистические методы в экологии: учебное пособие. Тольятти: Кассандра.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →