Вариационный вывод
Вариационный вывод (англ. variational inference, VI) — это метод аппроксимации сложных апостериорных распределений в байесовской статистике и машинном обучении. Он относится к классу детерминированных методов приближённого вывода, в отличие от методов Монте-Карло по схеме цепей Маркова (MCMC). Основная идея заключается в сведении задачи вычисления апостериорного распределения к задаче оптимизации: подбирается параметрическое семейство распределений, и ищется элемент этого семейства, наиболее близкий к истинному апостериорному распределению по некоторой метрике (обычно — по расхождению Кульбака — Лейблера). Вариационный вывод широко применяется в тематическом моделировании, глубоком обучении (вариационные автоэнкодеры), биоинформатике и компьютерном зрении.
История
Методы вариационного вывода берут начало в статистической физике и теории поля. В 1980-х годах идеи вариационного приближения были адаптированы для задач машинного обучения. В 1999 году Майкл Джордан и его коллеги формализовали вариационный вывод как общий подход к аппроксимации в байесовских сетях. Ключевой работой стала статья «An Introduction to Variational Methods for Graphical Models» (1999), где был предложен метод среднего поля (mean-field approximation). В 2000-х годах развитие получили методы стохастического вариационного вывода (SVI), позволяющие работать с большими данными. В 2013 году Дэвид Блей, Алипио Молина и другие представили чёрный ящик вариационного вывода (black-box VI), который не требует вычисления градиентов вручную. С 2014 года вариационный вывод стал основой для вариационных автоэнкодеров (VAE), предложенных Дидериком Кингмой и Максом Веллингом.
Математическая основа
Постановка задачи
Пусть имеется байесовская модель с наблюдаемыми данными \( x \) и скрытыми переменными \( z \). Апостериорное распределение \( p(z|x) \) задаётся по теореме Байеса:
\[ p(z|x) = \frac{p(x|z) p(z)}{p(x)}, \]
где \( p(x) = \int p(x|z) p(z) dz \) — маргинальная вероятность (evidence). Для многих моделей вычисление \( p(x) \) аналитически невозможно, поэтому апостериорное распределение не может быть найдено точно.
Идея вариационного вывода
Вводится параметрическое семейство распределений \( q(z; \lambda) \), где \( \lambda \) — вариационные параметры. Задача — найти такое \( q(z; \lambda) \), которое минимизирует расхождение Кульбака — Лейблера между \( q(z; \lambda) \) и истинным апостериорным распределением \( p(z|x) \):
\[ KL(q(z; \lambda) \parallel p(z|x)) = \int q(z; \lambda) \log \frac{q(z; \lambda)}{p(z|x)} dz. \]
Прямая минимизация этого расхождения невозможна, так как оно содержит \( p(z|x) \), которое неизвестно. Вместо этого максимизируется нижняя граница логарифмического правдоподобия (Evidence Lower BOund, ELBO):
\[ ELBO(\lambda) = \mathbb{E}_{q(z; \lambda)} [\log p(x, z) - \log q(z; \lambda)]. \]
Максимизация ELBO эквивалентна минимизации \( KL(q \parallel p) \), так как:
\[ \log p(x) = ELBO(\lambda) + KL(q(z; \lambda) \parallel p(z|x)). \]
Поскольку \( \log p(x) \) — константа (не зависит от \( \lambda \)), максимизация ELBO автоматически минимизирует расхождение.
Семейство среднего поля
Наиболее распространённый класс вариационных распределений — семейство среднего поля (mean-field), в котором скрытые переменные предполагаются независимыми:
\[ q(z; \lambda) = \prod_{i=1}^{m} q_i(z_i; \lambda_i). \]
В этом случае оптимизация ELBO может быть выполнена с помощью координатного подъёма (coordinate ascent variational inference, CAVI), при котором каждый вариационный параметр обновляется по очереди. Для экспонентных семейств обновления имеют аналитический вид.
Виды вариационного вывода
Координатный вариационный вывод (CAVI)
Классический метод, при котором каждый вариационный параметр обновляется итеративно с использованием условных ожиданий. Применим для моделей с сопряжёнными априорными распределениями. Недостаток — медленная сходимость на больших данных.
Стохастический вариационный вывод (SVI)
Предложен в 2013 году Мэттом Хоффманом, Дэвидом Блеем и Чонг Ваном. Использует стохастический градиентный подъём для оптимизации ELBO. На каждом шаге берётся мини-батч данных, и градиент оценивается по нему. Это позволяет обрабатывать большие объёмы данных и потоковые данные.
Чёрный ящик вариационного вывода (BBVI)
Метод, не требующий аналитического вычисления градиентов. Градиент ELBO оценивается с помощью метода репараметризации или логарифмического трюка (log-derivative trick). Это позволяет применять вариационный вывод к произвольным дифференцируемым моделям.
Амортизированный вариационный вывод
Используется в вариационных автоэнкодерах. Вместо того чтобы оптимизировать отдельные вариационные параметры для каждого наблюдения, обучается нейронная сеть (кодировщик), которая отображает данные в параметры вариационного распределения. Это позволяет эффективно обрабатывать большие наборы данных.
Применение
Тематическое моделирование
Вариационный вывод используется для обучения латентного размещения Дирихле (LDA) — одной из основных моделей тематического моделирования. В LDA скрытые переменные (темы документов и слов) аппроксимируются с помощью вариационного распределения среднего поля.
Вариационные автоэнкодеры (VAE)
В 2013 году Кингма и Веллинг предложили VAE — генеративную модель, в которой вариационный вывод используется для аппроксимации апостериорного распределения скрытых переменных. VAE стали основой для многих современных генеративных моделей, включая модели для генерации изображений, текста и звука.
Байесовские нейронные сети
Вариационный вывод применяется для обучения байесовских нейронных сетей, где веса сети рассматриваются как случайные величины. Это позволяет оценивать неопределённость предсказаний и улучшать устойчивость модели к переобучению.
Биоинформатика
В генетике и эпидемиологии вариационный вывод используется для анализа данных секвенирования, оценки структуры популяций и моделирования распространения заболеваний. Например, программа STRUCTURE использует вариационный вывод для определения генетической структуры популяций.
Компьютерное зрение
В задачах сегментации изображений, восстановления 3D-сцен и отслеживания объектов вариационный вывод позволяет аппроксимировать сложные апостериорные распределения параметров модели.
Преимущества и недостатки
Преимущества
- Скорость: вариационный вывод, как правило, быстрее методов MCMC, особенно на больших данных.
- Масштабируемость: стохастические варианты позволяют обрабатывать миллионы наблюдений.
- Детерминированность: результат оптимизации воспроизводим при одинаковых начальных условиях.
- Интеграция с глубоким обучением: амортизированный вариационный вывод легко комбинируется с нейронными сетями.
Недостатки
- Смещение аппроксимации: вариационное распределение может не совпадать с истинным апостериорным, особенно если семейство \( q \) выбрано слишком узким (например, среднее поле не учитывает корреляции между переменными).
- Локальные оптимумы: ELBO может иметь множество локальных максимумов, и оптимизация может не найти глобальный.
- Сложность настройки: выбор вариационного семейства и метода оптимизации требует опыта.
Сравнение с методами MCMC
Методы MCMC (например, сэмплер Гиббса, метрополис-гастингс) дают асимптотически точные оценки, но требуют больших вычислительных затрат и времени на сходимость. Вариационный вывод быстрее, но даёт приближённые результаты. На практике выбор между ними зависит от задачи: если точность критична (например, в научных исследованиях), предпочтительнее MCMC; если важна скорость и масштабируемость (например, в промышленных системах), используется вариационный вывод.
Интересные факты
- Термин «вариационный вывод» происходит от вариационного исчисления — раздела математики, изучающего экстремумы функционалов.
- В 2018 году группа исследователей из Google и DeepMind показала, что вариационный вывод может быть интерпретирован как обучение с подкреплением, где ELBO играет роль функции вознаграждения.
- Существуют гибридные методы, сочетающие вариационный вывод и MCMC, например, вариационные цепи Маркова (variational MCMC).
Источники
- Jordan, M. I., Ghahramani, Z., Jaakkola, T. S., & Saul, L. K. (1999). «An Introduction to Variational Methods for Graphical Models». Machine Learning, 37(2), 183–233.
- Blei, D. M., Kucukelbir, A., & McAuliffe, J. D. (2017). «Variational Inference: A Review for Statisticians». Journal of the American Statistical Association, 112(518), 859–877.
- Hoffman, M. D., Blei, D. M., Wang, C., & Paisley, J. (2013). «Stochastic Variational Inference». Journal of Machine Learning Research, 14, 1303–1347.
- Kingma, D. P., & Welling, M. (2014). «Auto-Encoding Variational Bayes». In Proceedings of the 2nd International Conference on Learning Representations (ICLR).
- Ranganath, R., Gerrish, S., & Blei, D. M. (2014). «Black Box Variational Inference». In Proceedings of the 17th International Conference on Artificial Intelligence and Statistics (AISTATS).
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →