Открыть сервис

Байесовское А/Б-тестирование

Байесовское А/Б-тестирование — это метод статистического сравнения двух или более вариантов (например, дизайна веб-страницы, алгоритма рекомендаций или маркетингового предложения), основанный на теореме Байеса. В отличие от классического (частотного) подхода, байесовский метод позволяет оценивать вероятности гипотез непосредственно на основе наблюдаемых данных и априорных знаний, а не только оперировать p-значениями и доверительными интервалами. Ключевая особенность — интерпретация результата в терминах вероятности того, что один вариант превосходит другой, а не в терминах «статистической значимости».

История и развитие

Методология байесовского вывода была разработана в XVIII веке пресвитерианским священником Томасом Байесом (1702–1761). Его работа «An Essay towards solving a Problem in the Doctrine of Chances» была опубликована посмертно в 1763 году. Однако практическое применение байесовского подхода к А/Б-тестированию стало возможным лишь с развитием вычислительных мощностей в конце XX — начале XXI века.

В 2000-х годах компании, работающие с большими объёмами данных (например, Google, Amazon, Booking.com), начали внедрять байесовские методы для оптимизации пользовательского опыта. Ключевым стимулом стала необходимость быстрого принятия решений в условиях ограниченных данных и высокой стоимости ошибки. В 2010-х годах байесовское А/Б-тестирование стало стандартным инструментом в продуктовой аналитике, особенно в сферах электронной коммерции, онлайн-рекламы и разработки программного обеспечения.

Теоретические основы

Байесовское А/Б-тестирование базируется на теореме Байеса, которая формально описывает, как следует обновлять априорные убеждения о параметрах (например, конверсии) после получения новых данных:

\[ P(\theta | D) = \frac{P(D | \theta) \cdot P(\theta)}{P(D)} \]

Где:

  • \(P(\theta | D)\) — апостериорное распределение вероятности параметра \(\theta\) после наблюдения данных \(D\).
  • \(P(D | \theta)\) — функция правдоподобия, вероятность наблюдения данных при заданном параметре.
  • \(P(\theta)\) — априорное распределение, отражающее начальные знания о параметре до эксперимента.
  • \(P(D)\) — нормализующая константа (маргинальная вероятность данных).

В контексте А/Б-тестирования параметром \(\theta\) обычно является конверсия (доля пользователей, совершивших целевое действие). Априорное распределение \(P(\theta)\) может быть задано на основе исторических данных, экспертных оценок или выбрано как неинформативное (например, бета-распределение Beta(1,1), эквивалентное равномерному распределению на [0,1]).

Априорное распределение

Выбор априорного распределения — критический этап, влияющий на результаты. Возможные варианты:

  • Неинформативное априорное распределение (например, Beta(1,1)) — используется, когда нет предварительных данных. Оно не смещает результат в какую-либо сторону, но требует большего объёма выборки для достижения точности.
  • Информативное априорное распределение — строится на основе исторических данных (например, средняя конверсия за прошлый месяц). Позволяет сократить необходимый объём данных, но может внести смещение, если прошлые данные нерелевантны.
  • Слабоинформативное априорное распределение (например, Beta(1,1) с параметрами, близкими к 1) — компромисс между двумя крайностями.

Апостериорное распределение

После сбора данных априорное распределение обновляется, и получается апостериорное распределение. Для бинарных исходов (конверсия/не конверсия) и бета-априорного распределения апостериорное распределение также является бета-распределением с параметрами:

\[ \alpha_{\text{post}} = \alpha_{\text{prior}} + \text{число успехов} \] \[ \beta_{\text{post}} = \beta_{\text{prior}} + \text{число неудач} \]

Это свойство называется сопряжённостью — бета-распределение является сопряжённым априорным для биномиального правдоподобия.

Процедура проведения

Типичный процесс байесовского А/Б-тестирования включает следующие шаги:

  1. Формулировка гипотезы — определение метрики (например, конверсия в покупку), вариантов (A — контроль, B — тест) и минимального эффекта, который считается практически значимым.
  2. Выбор априорного распределения — на основе исторических данных или экспертных оценок.
  3. Сбор данных — случайное распределение пользователей между вариантами. В отличие от частотного подхода, байесовский метод допускает остановку по достижении уверенности (sequential testing) без строгой фиксации размера выборки.
  4. Вычисление апостериорных распределений — для каждого варианта рассчитывается распределение вероятности параметра.
  5. Принятие решения — на основе апостериорных распределений вычисляются:
  • Вероятность превосходства (probability of being best) — вероятность того, что вариант B имеет более высокую конверсию, чем A.
  • Ожидаемые потери (expected loss) — средняя потеря от выбора неоптимального варианта.
  • Байесовский фактор — отношение правдоподобий двух гипотез.

Преимущества и недостатки

Преимущества

  • Интуитивная интерпретация: результат выражается как вероятность того, что один вариант лучше другого (например, «с вероятностью 95% вариант B превосходит A»). Это понятнее, чем p-значение.
  • Гибкость: возможность использовать априорную информацию, что особенно полезно при малых выборках или редких событиях.
  • Возможность последовательного анализа: байесовский подход не требует фиксированного размера выборки, что позволяет останавливать эксперимент раньше при достижении достаточной уверенности.
  • Учёт неопределённости: апостериорное распределение даёт полную картину вероятностей всех возможных значений параметра, а не только точечную оценку.

Недостатки

  • Субъективность выбора априорного распределения: разные априорные распределения могут привести к разным выводам, особенно при малых выборках.
  • Вычислительная сложность: для сложных моделей (например, с множеством метрик или нестандартными распределениями) требуется численное интегрирование или методы Монте-Карло по схеме марковской цепи (MCMC).
  • Меньшая распространённость в классической статистике: многие специалисты не знакомы с байесовским подходом, что затрудняет его внедрение в организациях, где приняты частотные методы.
  • Риск преждевременной остановки: хотя байесовский подход допускает последовательный анализ, при неправильном применении (например, при многократном «подглядывании» в данные) может возникнуть проблема множественных сравнений.

Применение

Байесовское А/Б-тестирование широко используется в:

  • Веб-аналитике и UX-дизайне: сравнение вариантов посадочных страниц, форм регистрации, кнопок призыва к действию.
  • Маркетинге: тестирование рекламных креативов, email-рассылок, ценовых предложений.
  • Разработке программного обеспечения: A/B-тестирование алгоритмов ранжирования, рекомендательных систем, интерфейсов.
  • Медицине и фармацевтике: клинические испытания, где байесовский подход позволяет эффективно использовать исторические данные и адаптивно изменять дизайн исследования.
  • Финансах: оценка эффективности инвестиционных стратегий, кредитных моделей.

Пример расчёта

Предположим, что проводится тестирование двух вариантов кнопки «Купить» на сайте. Контрольная группа (A) получила 100 конверсий из 1000 показов (конверсия 10%), тестовая группа (B) — 120 конверсий из 1000 показов (конверсия 12%). В качестве априорного распределения используется Beta(1,1) (неинформативное).

Апостериорное распределение для A: Beta(1+100, 1+900) = Beta(101, 901). Апостериорное распределение для B: Beta(1+120, 1+880) = Beta(121, 881).

Вероятность того, что B лучше A, вычисляется как интеграл от функции плотности распределения разности двух бета-распределений. В данном случае она составляет приблизительно 0,93 (93%). Это означает, что с 93% вероятностью вариант B превосходит A. Если порог принятия решения установлен на 95%, эксперимент следует продолжить; если на 90% — можно принять вариант B.

Критика

Основные критические замечания в адрес байесовского А/Б-тестирования связаны с субъективностью априорных распределений. Критики утверждают, что выбор априорного распределения может быть произвольным, что подрывает объективность результатов. Кроме того, в некоторых областях (например, в регулируемых клинических испытаниях) байесовский подход может быть менее приемлем из-за требований к строгой фиксации протокола.

Другая проблема — проблема множественных сравнений: при одновременном тестировании множества вариантов или метрик байесовский подход, как и частотный, требует корректировки, так как вероятность ложноположительного результата возрастает.

Сравнение с частотным подходом

ХарактеристикаБайесовский подходЧастотный подход
Интерпретация результатаВероятность гипотезы при данныхВероятность данных при гипотезе
Априорная информацияИспользуется явноНе используется
Размер выборкиНе фиксирован, возможна остановка по уверенностиФиксирован заранее
РезультатАпостериорное распределениеp-значение, доверительный интервал
Вычислительная сложностьВыше (часто требуется MCMC)Ниже
Популярность в индустрииРастёт, особенно в tech-компанияхТрадиционно доминирует

Интересные факты

  • В 2013 году компания Google опубликовала исследование, в котором показала, что байесовский подход позволяет сократить время A/B-тестирования на 30–50% по сравнению с частотным.
  • Байесовское А/Б-тестирование является основой для более сложных методов, таких как многорукие бандиты (multi-armed bandits), которые динамически перераспределяют трафик в пользу лучших вариантов.
  • В некоторых компаниях (например, Amazon) байесовское тестирование используется для одновременного сравнения десятков и сотен вариантов с помощью иерархических байесовских моделей.

Источники

  • Gelman, A., Carlin, J. B., Stern, H. S., Dunson, D. B., Vehtari, A., & Rubin, D. B. (2013). Bayesian Data Analysis (3rd ed.). CRC Press.
  • Kruschke, J. K. (2014). Doing Bayesian Data Analysis: A Tutorial with R, JAGS, and Stan (2nd ed.). Academic Press.
  • McElreath, R. (2020). Statistical Rethinking: A Bayesian Course with Examples in R and Stan (2nd ed.). CRC Press.
  • Kohavi, R., Tang, D., & Xu, Y. (2020). Trustworthy Online Controlled Experiments: A Practical Guide to A/B Testing. Cambridge University Press.
  • Google. (2013). «Bayesian Approach to A/B Testing». Google AI Blog.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →