Открыть сервис

Априорное распределение

Априорное распределение (также априорная вероятность, prior distribution) — в байесовской статистике распределение вероятностей, которое выражает степень уверенности исследователя в значении параметра до получения эмпирических данных. Априорное распределение является ключевым элементом байесовского вывода, позволяя объединить априорные знания (предшествующую информацию, экспертные оценки, результаты предыдущих исследований) с наблюдаемыми данными для получения апостериорного распределения.

История

Концепция априорного распределения восходит к работам Томаса Байеса (1702–1761), опубликованным посмертно в 1763 году. В его эссе «An Essay towards solving a Problem in the Doctrine of Chances» была заложена основа для теоремы Байеса, которая формализует обновление вероятностей на основе новых данных. Однако сам термин «априорное распределение» и его систематическое использование в статистике появились значительно позже.

В XIX веке Пьер-Симон Лаплас активно применял принцип равномерного априорного распределения (принцип безразличия), утверждая, что при отсутствии информации все возможные значения параметра следует считать равновероятными. Этот подход, однако, критиковался за субъективность и парадоксы (например, парадокс Бертрана).

В XX веке развитие байесовской статистики связано с работами Гарольда Джеффриса (1939), который предложил инвариантные априорные распределения (априорное распределение Джеффриса), и Леонарда Сэвиджа (1954), который обосновал субъективную интерпретацию вероятности. В 1960–1980-х годах байесовский подход получил широкое распространение в прикладных областях, включая машинное обучение, биоинформатику и экономику.

Определение и формализация

Пусть \(\theta\) — параметр модели (скалярный или векторный), который подлежит оценке. Априорное распределение \(p(\theta)\) задаёт плотность вероятности (или вероятностную массу) для \(\theta\) до наблюдения данных \(X\). После получения данных априорное распределение обновляется до апостериорного \(p(\theta|X)\) по формуле:

\[ p(\theta|X) = \frac{p(X|\theta) \cdot p(\theta)}{p(X)} \]

где \(p(X|\theta)\) — функция правдоподобия, а \(p(X)\) — маргинальная вероятность данных (нормировочная константа).

Априорное распределение должно быть задано на множестве всех возможных значений \(\theta\) (параметрическом пространстве) и удовлетворять условию нормировки: \(\int p(\theta) d\theta = 1\) (для непрерывного случая) или \(\sum p(\theta) = 1\) (для дискретного).

Виды априорных распределений

Информативные априорные распределения

Информативное априорное распределение содержит конкретную предшествующую информацию о параметре. Например, если из предыдущих исследований известно, что среднее значение некоторой величины составляет 100 с дисперсией 15, то в качестве априорного можно использовать нормальное распределение \(N(100, 15^2)\). Информативные априорные распределения часто применяются в медицинской статистике, где данные предыдущих клинических испытаний используются для уточнения оценок в новых исследованиях.

Слабоинформативные априорные распределения

Слабоинформативные априорные распределения (weakly informative priors) задают широкий диапазон возможных значений, но не являются полностью равномерными. Они вводят мягкие ограничения, чтобы избежать нереалистичных значений параметров, но при этом не доминируют над данными. Например, для коэффициента регрессии можно использовать нормальное распределение \(N(0, 10^2)\), которое допускает как положительные, так и отрицательные значения, но ограничивает их по порядку величины.

Неинформативные априорные распределения

Неинформативные априорные распределения (non-informative priors) стремятся минимизировать влияние априорной информации на результат, оставляя данные «говорить сами за себя». Наиболее распространённый пример — равномерное распределение на ограниченном интервале. Однако для неограниченных параметров (например, дисперсии) равномерное распределение может быть несобственным (неинтегрируемым), что требует осторожности.

Априорное распределение Джеффриса — инвариантное относительно преобразований параметра неинформативное априорное распределение, определяемое как:

\[ p(\theta) \propto \sqrt{I(\theta)} \]

где \(I(\theta)\) — информация Фишера. Например, для параметра масштаба \(\sigma\) (стандартное отклонение нормального распределения) априорное распределение Джеффриса имеет вид \(p(\sigma) \propto 1/\sigma\).

Сопряжённые априорные распределения

Сопряжённое априорное распределение — такое распределение, при котором апостериорное распределение принадлежит тому же семейству, что и априорное. Это свойство упрощает аналитические вычисления. Например, для биномиального правдоподобия сопряжённым является бета-распределение, для пуассоновского — гамма-распределение, для нормального (с известной дисперсией) — нормальное распределение.

Выбор априорного распределения

Выбор априорного распределения является одним из наиболее дискуссионных аспектов байесовской статистики. Основные подходы:

  • Субъективный байесианский подход (Сэвидж): априорное распределение отражает личную степень уверенности исследователя и может быть различным для разных специалистов.
  • Объективный байесианский подход (Джеффрис, Бернардо): априорное распределение должно быть выбрано по формальным правилам (например, по принципу инвариантности или максимизации энтропии), чтобы минимизировать субъективность.
  • Эмпирический байесианский подход: априорное распределение оценивается по данным (например, с помощью метода моментов), что нарушает строгую байесовскую схему, но часто оказывается удобным на практике.

Применение

Машинное обучение

В байесовском машинном обучении априорные распределения используются для регуляризации моделей. Например, в байесовской линейной регрессии априорное распределение на коэффициенты \(w\) (например, нормальное \(N(0, \lambda^{-1})\)) эквивалентно L2-регуляризации (гребневой регрессии). Априорное распределение Лапласа приводит к L1-регуляризации (LASSO).

Биоинформатика

В анализе данных секвенирования ДНК априорные распределения используются для оценки частот мутаций, экспрессии генов и метилирования. Например, в модели DESeq2 для анализа дифференциальной экспрессии генов используется слабоинформативное априорное распределение для дисперсии.

Экономика и финансы

В экономических моделях априорные распределения задаются на структурные параметры (например, эластичность спроса, коэффициент дисконтирования) на основе макроэкономической теории или предыдущих исследований. Байесовский подход позволяет объединять данные разных стран и временных периодов.

Медицинская статистика

В клинических испытаниях априорные распределения используются для включения информации из предыдущих исследований (например, результатов фазы I и II испытаний в анализ фазы III). Это позволяет сократить объём выборки и повысить статистическую мощность.

Критика и ограничения

Основная критика априорных распределений связана с их субъективностью. Если априорное распределение выбрано неудачно, оно может исказить результаты, особенно при малом объёме данных. Критики (в частности, представители частотной школы статистики) утверждают, что байесовские методы позволяют «подгонять» результаты под желаемый вывод путём выбора подходящего априорного распределения.

Другая проблема — несобственные априорные распределения (неинтегрируемые), которые могут приводить к некорректным апостериорным распределениям. Для их использования требуется проверка, что апостериорное распределение является собственным.

Также существуют практические трудности: для сложных многомерных моделей задание осмысленного априорного распределения может быть нетривиальной задачей, требующей глубокого понимания предметной области.

Источники

  1. Байес Т. «An Essay towards solving a Problem in the Doctrine of Chances» (1763).
  2. Jeffreys H. «Theory of Probability» (1939).
  3. Savage L. J. «The Foundations of Statistics» (1954).
  4. Gelman A., Carlin J. B., Stern H. S., Rubin D. B. «Bayesian Data Analysis» (3rd ed., 2013).
  5. Berger J. O. «Statistical Decision Theory and Bayesian Analysis» (2nd ed., 1985).
  6. Bernardo J. M., Smith A. F. M. «Bayesian Theory» (1994).

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →