Метод приближённого байесовского вычисления
Метод приближённого байесовского вычисления (англ. Approximate Bayesian Computation, ABC) — это класс вычислительных методов, используемых в байесовской статистике для оценки параметров вероятностных моделей, когда функция правдоподобия (вероятность наблюдения данных при заданных параметрах) является аналитически невычислимой или чрезвычайно сложной для расчёта. ABC позволяет аппроксимировать апостериорное распределение параметров, не вычисляя правдоподобие напрямую, а путём сравнения наблюдаемых данных с данными, симулированными из модели при различных значениях параметров.
История
Метод приближённого байесовского вычисления возник в популяционной генетике в конце 1990-х — начале 2000-х годов. В 1997 году Дж. К. Притчард и его коллеги предложили подход, основанный на симуляции данных, для оценки параметров демографических моделей. В 2002 году М. Бомонт, В. Чжан и Д. Балдинг формализовали алгоритм, включив в него этап отбора симуляций по близости к наблюдаемым данным. С тех пор ABC распространился на многие области, включая экологию, эпидемиологию, эволюционную биологию, физику и машинное обучение.
Основная идея и принцип работы
В классическом байесовском выводе апостериорное распределение параметров \( \theta \) вычисляется по формуле: \[ P(\theta | D) = \frac{P(D | \theta) P(\theta)}{P(D)}, \] где \( P(D | \theta) \) — функция правдоподобия, \( P(\theta) \) — априорное распределение, а \( P(D) \) — маргинальная вероятность данных. Если правдоподобие неизвестно или невычислимо, ABC обходит эту проблему, заменяя его на сравнение симулированных данных \( D_{\text{sim}} \) с наблюдаемыми \( D_{\text{obs}} \).
Алгоритм ABC работает следующим образом:
- Из априорного распределения \( P(\theta) \) случайным образом выбирается значение параметра \( \theta^* \).
- С помощью модели генерируется набор симулированных данных \( D_{\text{sim}} \) при этом значении параметра.
- Вычисляется расстояние (например, евклидово или на основе сводных статистик) между \( D_{\text{sim}} \) и \( D_{\text{obs}} \).
- Если расстояние меньше заданного порога \( \epsilon \), то \( \theta^* \) принимается как образец из аппроксимированного апостериорного распределения.
- Шаги 1–4 повторяются многократно (обычно тысячи или миллионы раз), после чего полученные принятые значения параметров образуют выборку, аппроксимирующую апостериорное распределение.
Разновидности методов ABC
ABC с отбором по порогу (ABC rejection)
Это базовый вариант, описанный выше. Все симуляции, для которых расстояние превышает порог \( \epsilon \), отвергаются. Эффективность метода зависит от выбора порога: слишком малый \( \epsilon \) приводит к высокой точности, но требует огромного числа симуляций; слишком большой — даёт грубую аппроксимацию.
ABC с использованием сводных статистик (ABC-SS)
Для сложных данных (например, последовательностей ДНК или временных рядов) прямое сравнение всех точек данных может быть вычислительно затратным. Вместо этого используются сводные статистики — функции, сжимающие данные в небольшой набор чисел (например, среднее, дисперсия, корреляция). Расстояние вычисляется между сводными статистиками симулированных и наблюдаемых данных. Выбор адекватных сводных статистик критически важен для точности.
ABC с марковскими цепями Монте-Карло (ABC-MCMC)
Этот метод интегрирует ABC в алгоритм MCMC. Вместо независимого отбора из априорного распределения, параметры последовательно обновляются с помощью предложений, и принятие или отклонение происходит на основе сравнения симулированных и наблюдаемых данных. ABC-MCMC может быть более эффективным, чем ABC rejection, особенно при узких апостериорных распределениях.
ABC с последовательным Монте-Карло (ABC-SMC)
В ABC-SMC априорное распределение постепенно уточняется через несколько раундов (популяций). На каждом раунде порог \( \epsilon \) уменьшается, а выборка параметров из предыдущего раунда используется в качестве априорного распределения для следующего. Это позволяет избежать проблем с низкой эффективностью ABC rejection при малых порогах.
Применение
Популяционная генетика
ABC широко применяется для оценки демографических параметров (например, времени расхождения популяций, численности популяций, скорости миграции) на основе генетических данных. В частности, метод используется для реконструкции истории видов, когда полные геномные последовательности недоступны.
Экология и эволюционная биология
В экологии ABC применяется для моделирования динамики популяций, распространения видов и оценки параметров экологических сетей. В эволюционной биологии — для изучения адаптации, филогенетических деревьев и процессов видообразования.
Эпидемиология
ABC используется для оценки параметров распространения инфекционных заболеваний, таких как скорость передачи, инкубационный период и эффективность мер контроля, особенно когда данные о заболеваемости неполны или зашумлены.
Физика и астрофизика
В физике элементарных частиц и космологии ABC применяется для калибровки моделей, когда симуляции сложны (например, моделирование галактик или столкновений частиц). Метод позволяет оценивать параметры, не требуя аналитического правдоподобия.
Машинное обучение
ABC используется в задачах, где модель является «чёрным ящиком», например, в нейронных сетях или симуляторах, для настройки гиперпараметров или оценки неопределённости.
Преимущества и недостатки
Преимущества
- Не требует вычисления функции правдоподобия, что делает его применимым к широкому классу моделей.
- Простота реализации: базовый алгоритм ABC rejection легко программируется.
- Возможность работы с любыми типами данных, если можно сгенерировать симулированные данные.
Недостатки
- Высокая вычислительная стоимость: для получения точной аппроксимации требуется большое количество симуляций (часто миллионы).
- Чувствительность к выбору сводных статистик: неверный выбор может привести к смещению или потере информации.
- Проблема выбора порога \( \epsilon \): слишком малый порог делает метод неэффективным, слишком большой — неточным.
- Трудности с многомерными параметрами: эффективность ABC падает с ростом размерности пространства параметров.
Критика и ограничения
Критики ABC отмечают, что метод даёт лишь приближённое, а не точное апостериорное распределение. При неправильном выборе сводных статистик или порога результаты могут быть сильно искажены. Кроме того, ABC не гарантирует сходимость к истинному апостериорному распределению при конечном числе симуляций. В некоторых случаях, особенно при наличии шума в данных, метод может давать ложные выводы. Тем не менее, ABC остаётся популярным инструментом в ситуациях, где альтернативные методы (например, вариационный вывод или MCMC с правдоподобием) неприменимы.
Интересные факты
- Первое применение ABC в популяционной генетике было связано с оценкой времени расхождения человеческих популяций на основе митохондриальной ДНК.
- ABC часто называют «бесправдоподобным» байесовским выводом (likelihood-free inference).
- В 2010-х годах ABC был адаптирован для анализа данных с помощью глубоких нейронных сетей, что позволило частично автоматизировать выбор сводных статистик.
Источники
- Beaumont M. A., Zhang W., Balding D. J. Approximate Bayesian computation in population genetics. — Genetics, 2002.
- Pritchard J. K., Seielstad M. T., Perez-Lezaun A., Feldman M. W. Population growth of human Y chromosomes: a study of Y chromosome microsatellites. — Molecular Biology and Evolution, 1999.
- Sisson S. A., Fan Y., Tanaka M. M. Sequential Monte Carlo without likelihoods. — Proceedings of the National Academy of Sciences, 2007.
- Csilléry K., Blum M. G. B., Gaggiotti O. E., François O. Approximate Bayesian computation (ABC) in practice. — Trends in Ecology & Evolution, 2010.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →