Открыть сервис

Биномиальный тест

Биномиальный тест — это статистический критерий, используемый для проверки гипотез о значении вероятности успеха в биномиальном распределении. Он применяется в ситуациях, когда результаты эксперимента представляют собой последовательность независимых испытаний, каждое из которых имеет ровно два исхода (например, «успех» и «неудача»), а вероятность успеха предполагается постоянной для всех испытаний. Тест позволяет определить, насколько наблюдаемое число успехов согласуется с предполагаемой вероятностью, и является одним из наиболее точных методов для анализа дихотомических данных, особенно при малых объёмах выборки, когда аппроксимации нормальным распределением могут быть неточными.

История

Биномиальный тест берёт своё начало из работ Якоба Бернулли, который в конце XVII века ввёл понятие биномиального распределения в своей книге «Искусство предположений» (Ars Conjectandi, опубликована посмертно в 1713 году). Однако формализация теста как статистической процедуры произошла значительно позже, в начале XX века, в рамках развития теории проверки статистических гипотез. Значительный вклад в это внесли Рональд Фишер, который в 1920-х годах разработал концепцию точного критерия Фишера для таблиц сопряжённости, и Ежи Нейман с Эгоном Пирсоном, сформулировавшие общую теорию проверки гипотез. Биномиальный тест стал широко применяться в биологии, медицине, психологии и социологии для анализа данных, где ответы имеют бинарную природу (например, выздоровел/не выздоровел, согласен/не согласен). С развитием вычислительной техники в середине XX века тест стал доступен для расчётов на больших выборках, хотя его точная форма осталась востребованной из-за отсутствия необходимости в аппроксимациях.

Математическая основа

Биномиальное распределение

Биномиальный тест основан на биномиальном распределении, которое описывает вероятность получения ровно \( k \) успехов в \( n \) независимых испытаниях, где вероятность успеха в каждом испытании равна \( p \). Функция вероятности задаётся формулой:

\[ P(X = k) = \binom{n}{k} p^k (1-p)^{n-k} \]

где \(\binom{n}{k} = \frac{n!}{k!(n-k)!}\) — биномиальный коэффициент.

Гипотезы

Тест формулируется как проверка нулевой гипотезы \( H_0: p = p_0 \) против одной из альтернативных гипотез:

  • \( H_1: p \neq p_0 \) (двусторонний тест),
  • \( H_1: p > p_0 \) (односторонний тест, правосторонний),
  • \( H_1: p < p_0 \) (односторонний тест, левосторонний).

Здесь \( p_0 \) — предполагаемое значение вероятности успеха, которое задаётся исследователем на основе теоретических соображений или предыдущих данных.

Расчёт p-значения

Для наблюдаемого числа успехов \( k \) p-значение (вероятность получить такое же или более экстремальное значение при условии истинности \( H_0 \)) вычисляется суммированием вероятностей биномиального распределения:

  • Для одностороннего теста (\( H_1: p > p_0 \)): \( p\text{-value} = \sum_{i=k}^{n} \binom{n}{i} p_0^i (1-p_0)^{n-i} \).
  • Для одностороннего теста (\( H_1: p < p_0 \)): \( p\text{-value} = \sum_{i=0}^{k} \binom{n}{i} p_0^i (1-p_0)^{n-i} \).
  • Для двустороннего теста: p-значение равно сумме вероятностей для всех значений \( i \), для которых \( P(X = i) \leq P(X = k) \), то есть включает обе «хвосты» распределения.

Если p-значение меньше заранее заданного уровня значимости \( \alpha \) (обычно 0,05 или 0,01), нулевая гипотеза отвергается в пользу альтернативной.

Применение

Медицина и биология

Биномиальный тест часто используется в клинических исследованиях для оценки эффективности лечения. Например, если из 20 пациентов, получавших новый препарат, выздоровели 15, а ожидаемая вероятность выздоровления при стандартном лечении составляет 0,5, тест позволяет проверить, значимо ли отличается наблюдаемый результат от случайного. В генетике тест применяется для проверки соответствия наблюдаемых частот аллелей менделевским законам наследования (например, ожидаемое соотношение 3:1).

Психология и социология

В опросах общественного мнения биномиальный тест используется для анализа бинарных ответов, таких как «да/нет» или «согласен/не согласен». Например, если в выборке из 100 респондентов 60 поддерживают определённую политику, а нулевая гипотеза предполагает, что поддержка составляет 50 %, тест позволяет оценить, является ли это отклонение статистически значимым.

Контроль качества

В промышленности тест применяется для проверки доли бракованных изделий в партии. Если из 50 деталей 2 оказались бракованными, а допустимый уровень брака составляет 5 %, биномиальный тест помогает определить, превышает ли наблюдаемая доля допустимый порог.

Компьютерные науки

В машинном обучении биномиальный тест используется для сравнения точности двух классификаторов. Например, если один классификатор правильно предсказал 80 из 100 примеров, а другой — 70, тест проверяет, является ли разница статистически значимой.

Сравнение с другими критериями

Точный критерий Фишера

Биномиальный тест и точный критерий Фишера оба являются точными, то есть не требуют аппроксимаций, но различаются по применению. Критерий Фишера используется для анализа таблиц сопряжённости 2×2, когда обе переменные являются категориальными и фиксированы маргинальные суммы. Биномиальный тест применяется, когда одна из переменных (число испытаний) фиксирована, а другая (число успехов) является случайной.

Z-тест для пропорций

Z-тест (или тест на основе нормального приближения) является асимптотическим и предполагает, что при больших \( n \) биномиальное распределение можно аппроксимировать нормальным. Он проще в расчётах, но менее точен при малых выборках (обычно \( n < 30 \) или когда \( np_0 \) или \( n(1-p_0) \) меньше 5). Биномиальный тест предпочтительнее в таких случаях, так как даёт точное p-значение.

Критерий хи-квадрат

Критерий хи-квадрат Пирсона также может использоваться для проверки пропорций, но он является приближённым и требует, чтобы ожидаемые частоты в каждой категории были не менее 5. Биномиальный тест не имеет такого ограничения.

Ограничения и критика

  • Предположение о независимости: Тест предполагает, что все испытания независимы. Нарушение этого условия (например, в случае кластеризованных данных) может привести к завышению значимости.
  • Фиксированное число испытаний: Тест требует, чтобы число испытаний \( n \) было задано заранее, а не определялось по ходу эксперимента (например, в случае последовательного анализа).
  • Чувствительность к малому числу испытаний: При очень малых \( n \) (например, \( n < 5 \)) тест может иметь низкую мощность, то есть неспособность обнаружить реальные отклонения.
  • Двусторонние тесты: Расчёт p-значения для двустороннего теста может быть нетривиальным, так как требует определения «более экстремальных» значений, что иногда приводит к консервативным результатам.

Пример

Предположим, что монету подбрасывают 10 раз, и выпадает 9 орлов. Нулевая гипотеза: монета симметрична (\( p_0 = 0,5 \)). Альтернативная гипотеза: монета смещена в сторону орлов (\( p > 0,5 \)). Вероятность получить 9 или 10 орлов при \( p = 0,5 \) равна:

\[ P(X \geq 9) = \binom{10}{9} (0,5)^{10} + \binom{10}{10} (0,5)^{10} = 10 \cdot 0,0009766 + 0,0009766 \approx 0,0107. \]

При уровне значимости \( \alpha = 0,05 \) p-значение (0,0107) меньше 0,05, поэтому нулевая гипотеза отвергается. Это означает, что наблюдаемые данные дают основания считать монету несимметричной.

Интересные факты

  • Биномиальный тест является частным случаем точного критерия для таблиц сопряжённости 2×2, когда одна из маргинальных сумм (число испытаний) фиксирована.
  • В статистическом пакете R тест реализован функцией binom.test(), которая позволяет задавать как односторонние, так и двусторонние гипотезы.
  • Несмотря на свою простоту, тест остаётся одним из наиболее надёжных методов для анализа бинарных данных, особенно в условиях малых выборок, где асимптотические методы могут давать ошибочные результаты.

Источники

  • Lehmann, E. L., & Romano, J. P. (2005). Testing Statistical Hypotheses (3rd ed.). Springer.
  • Agresti, A. (2013). Categorical Data Analysis (3rd ed.). Wiley.
  • Fisher, R. A. (1925). Statistical Methods for Research Workers. Oliver and Boyd.
  • Sheskin, D. J. (2011). Handbook of Parametric and Nonparametric Statistical Procedures (5th ed.). CRC Press.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →