Сопряжённое распределение
Сопряжённое распределение — это распределение вероятностей, которое, будучи взятым в качестве априорного распределения для некоторого параметра, приводит к тому, что апостериорное распределение этого параметра принадлежит тому же семейству распределений, что и априорное. Понятие является центральным в байесовской статистике, где оно позволяет существенно упростить аналитические вычисления, избегая численного интегрирования при обновлении вероятностей.
История и происхождение
Идея сопряжённых распределений возникла в контексте развития байесовского подхода к статистике, основанного на теореме Томаса Байеса (опубликована посмертно в 1763 году). Однако систематическое изучение и формализация этого понятия относятся к середине XX века. Значительный вклад в развитие теории внесли американские статистики Гарольд Джеффрис и Деннис Линдли, которые показали, что для многих стандартных распределений (нормального, пуассоновского, биномиального) существуют естественные семейства сопряжённых априорных распределений. Термин «сопряжённое распределение» (conjugate prior) был введён в обиход в работах Линдли в 1960-х годах.
Определение и формальная запись
Пусть \( P(\theta) \) — априорное распределение параметра \( \theta \), а \( P(x|\theta) \) — функция правдоподобия (вероятность наблюдения данных \( x \) при заданном \( \theta \)). Согласно теореме Байеса, апостериорное распределение \( P(\theta|x) \) пропорционально произведению априорного распределения и правдоподобия:
\[ P(\theta|x) \propto P(\theta) \cdot P(x|\theta) \]
Если априорное распределение \( P(\theta) \) выбрано из параметрического семейства \( \mathcal{F} \), и апостериорное распределение \( P(\theta|x) \) также принадлежит \( \mathcal{F} \) (возможно, с другими значениями параметров), то \( P(\theta) \) называется сопряжённым априорным распределением для данного правдоподобия \( P(x|\theta) \).
Ключевые свойства и преимущества
Использование сопряжённых распределений даёт несколько практических преимуществ:
- Аналитическая трактуемость: Апостериорное распределение вычисляется в явном виде, без необходимости численного интегрирования или методов Монте-Карло. Это особенно важно в задачах, где требуется многократное обновление распределений (например, в онлайн-обучении).
- Интерпретируемость гиперпараметров: Параметры априорного распределения (гиперпараметры) можно интерпретировать как количество «псевдонаблюдений», добавляемых к реальным данным. Например, в бета-биномиальной модели параметры \( \alpha \) и \( \beta \) бета-распределения можно рассматривать как число успехов и неудач в гипотетических предыдущих испытаниях.
- Удобство для последовательного анализа: При поступлении новых данных апостериорное распределение, полученное на предыдущем шаге, становится априорным для следующего шага, оставаясь в том же семействе.
Основные пары сопряжённых распределений
На практике наиболее часто используются следующие пары «правдоподобие — сопряжённое априорное распределение»:
| Правдоподобие (модель данных) | Параметр модели | Сопряжённое априорное распределение | Апостериорное распределение |
|---|---|---|---|
| Бернулли или Биномиальное | Вероятность успеха \( p \) | Бета-распределение \( \text{Beta}(\alpha, \beta) \) | \( \text{Beta}(\alpha + k, \beta + n - k) \), где \( k \) — число успехов, \( n \) — число испытаний |
| Пуассоновское | Интенсивность \( \lambda \) | Гамма-распределение \( \text{Gamma}(\alpha, \beta) \) | \( \text{Gamma}(\alpha + \sum x_i, \beta + n) \) |
| Нормальное (известная дисперсия \( \sigma^2 \)) | Среднее \( \mu \) | Нормальное распределение \( \mathcal{N}(\mu_0, \tau_0^2) \) | \( \mathcal{N}\left( \frac{\mu_0/\tau_0^2 + \sum x_i/\sigma^2}{1/\tau_0^2 + n/\sigma^2}, \frac{1}{1/\tau_0^2 + n/\sigma^2} \right) \) |
| Нормальное (известное среднее \( \mu \)) | Дисперсия \( \sigma^2 \) | Обратное гамма-распределение \( \text{Inv-Gamma}(\alpha, \beta) \) | \( \text{Inv-Gamma}\left(\alpha + \frac{n}{2}, \beta + \frac{1}{2}\sum (x_i - \mu)^2 \right) \) |
| Мультиномиальное | Вектор вероятностей \( \mathbf{p} \) | Распределение Дирихле \( \text{Dir}(\boldsymbol{\alpha}) \) | \( \text{Dir}(\boldsymbol{\alpha} + \mathbf{c}) \), где \( \mathbf{c} \) — вектор частот категорий |
| Экспоненциальное | Параметр скорости \( \lambda \) | Гамма-распределение \( \text{Gamma}(\alpha, \beta) \) | \( \text{Gamma}(\alpha + n, \beta + \sum x_i) \) |
Пример: Бета-биномиальная модель
Рассмотрим задачу оценки вероятности \( p \) того, что подброшенная монета выпадет орлом. Пусть априорное распределение \( p \) задано как \( \text{Beta}(2, 2) \) (симметричное распределение, предполагающее, что монета, скорее всего, честная). После 10 подбрасываний получено 7 орлов (успехов) и 3 решки (неудач). Апостериорное распределение будет \( \text{Beta}(2+7, 2+3) = \text{Beta}(9, 5) \). Таким образом, оценка вероятности смещается в сторону 9/(9+5) ≈ 0.64.
Сопряжённые распределения в экспоненциальном семействе
Важным теоретическим результатом является то, что для любого распределения, принадлежащего экспоненциальному семейству (нормальное, пуассоновское, биномиальное, гамма и др.), существует сопряжённое априорное распределение. Оно также принадлежит экспоненциальному семейству и имеет вид:
\[ P(\theta | \tau, \nu) \propto \exp\left( \tau \cdot T(\theta) - \nu \cdot A(\theta) \right) \]
где \( T(\theta) \) — достаточная статистика, \( A(\theta) \) — логарифм нормировочной функции, а \( \tau \) и \( \nu \) — гиперпараметры. Этот факт позволяет строить сопряжённые априорные распределения для широкого класса моделей.
Критика и ограничения
Несмотря на удобство, использование сопряжённых распределений имеет ограничения:
- Ограниченная гибкость: Сопряжённые распределения часто не отражают истинные априорные убеждения исследователя, так как выбор семейства диктуется математическим удобством, а не содержательной интерпретацией.
- Неприменимость для сложных моделей: В современных байесовских моделях (например, в иерархических моделях или нейронных сетях) сопряжённые распределения либо отсутствуют, либо приводят к чрезвычайно громоздким выражениям. В таких случаях предпочтение отдаётся методам численного сэмплирования (MCMC, вариационный вывод).
- Субъективность выбора гиперпараметров: Выбор конкретных значений гиперпараметров сопряжённого априорного распределения может существенно влиять на результат, особенно при малом объёме данных.
Применение
Сопряжённые распределения широко применяются в:
- Байесовском выводе: Для оценки параметров распределений в задачах классификации, регрессии и кластеризации.
- Машинном обучении: В моделях латентного размещения Дирихле (LDA), гауссовских смесях и байесовских сетях.
- Финансовой математике: Для моделирования волатильности и доходностей активов.
- Биостатистике: При анализе клинических испытаний и эпидемиологических данных, где требуется последовательное обновление оценок.
Интересные факты
- Сопряжённые распределения являются частным случаем более общего понятия — приорных распределений Джеффриса, которые инвариантны относительно репараметризации модели. Однако приоры Джеффриса не всегда являются сопряжёнными.
- В некоторых случаях сопряжённое априорное распределение может быть несобственным (его интеграл по области определения расходится), но при этом апостериорное распределение оказывается собственным. Примером служит равномерное распределение на всей числовой прямой как сопряжённое для нормального среднего.
Источники
- Gelman, A., Carlin, J. B., Stern, H. S., Dunson, D. B., Vehtari, A., & Rubin, D. B. (2013). Bayesian Data Analysis (3rd ed.). CRC Press.
- DeGroot, M. H. (1970). Optimal Statistical Decisions. McGraw-Hill.
- Lindley, D. V. (1965). Introduction to Probability and Statistics from a Bayesian Viewpoint. Cambridge University Press.
- Jeffreys, H. (1961). Theory of Probability (3rd ed.). Oxford University Press.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →