Гауссовские процессы
Гауссовский процесс — это случайный процесс, представляющий собой совокупность случайных величин, любое конечное подмножество которых имеет совместное многомерное нормальное распределение. Гауссовские процессы являются обобщением понятия многомерного нормального распределения на бесконечномерное пространство функций и широко используются в статистике, машинном обучении и теории вероятностей для моделирования неопределённости и регрессии.
Определение и математическая формализация
Формально, гауссовский процесс \( f(x) \) определяется своей функцией среднего \( m(x) \) и ковариационной функцией (ядром) \( k(x, x') \):
\[ f(x) \sim \mathcal{GP}(m(x), k(x, x')) \]
где \( m(x) = \mathbb{E}[f(x)] \) — математическое ожидание процесса в точке \( x \), а \( k(x, x') = \mathbb{E}[(f(x) - m(x))(f(x') - m(x'))] \) — ковариация между значениями процесса в точках \( x \) и \( x' \). Для любого конечного набора точек \( X = \{x_1, x_2, \dots, x_n\} \) вектор значений \( \mathbf{f} = (f(x_1), f(x_2), \dots, f(x_n))^T \) следует многомерному нормальному распределению:
\[ \mathbf{f} \sim \mathcal{N}(\mathbf{m}, K) \]
где \( \mathbf{m} = (m(x_1), m(x_2), \dots, m(x_n))^T \) — вектор средних, а \( K \) — ковариационная матрица размера \( n \times n \) с элементами \( K_{ij} = k(x_i, x_j) \).
Ковариационные функции (ядра)
Выбор ковариационной функции определяет свойства гауссовского процесса, такие как гладкость, периодичность и стационарность. Наиболее распространённые ядра включают:
- Радиальная базисная функция (RBF), или экспоненциально-квадратичное ядро:
\[ k(x, x') = \sigma^2 \exp\left(-\frac{(x - x')^2}{2l^2}\right) \] где \( \sigma^2 \) — дисперсия, а \( l \) — длина масштаба. Это ядро порождает бесконечно дифференцируемые функции.
- Матерновское ядро:
\[ k(x, x') = \sigma^2 \frac{2^{1-\nu}}{\Gamma(\nu)} \left( \frac{\sqrt{2\nu}|x - x'|}{l} \right)^\nu K_\nu \left( \frac{\sqrt{2\nu}|x - x'|}{l} \right) \] где \( \nu \) — параметр гладкости, \( K_\nu \) — модифицированная функция Бесселя второго рода. При \( \nu \to \infty \) сводится к RBF.
- Периодическое ядро:
\[ k(x, x') = \sigma^2 \exp\left(-\frac{2\sin^2(\pi|x - x'|/p)}{l^2}\right) \] где \( p \) — период.
- Линейное ядро:
\[ k(x, x') = \sigma^2 (x \cdot x' + c) \]
История
Концепция гауссовских процессов восходит к работам Андрея Николаевича Колмогорова, который в 1941 году в своей книге «Основные понятия теории вероятностей» заложил основы теории случайных процессов. В 1950-х годах Норберт Винер и другие исследователи развили теорию винеровского процесса, который является частным случаем гауссовского процесса. В 1970-х годах Ричард О'Хэган и другие статистики начали применять гауссовские процессы для байесовской интерполяции и регрессии. Современное развитие методов связано с работами Карла Расмуссена и Кристофера Уильямса, чья книга «Gaussian Processes for Machine Learning» (2006) стала стандартным справочником.
Применение в машинном обучении
Регрессия на основе гауссовских процессов (GPR)
Гауссовские процессы используются для решения задач регрессии, где требуется не только предсказать значение функции в новой точке, но и оценить неопределённость предсказания. В байесовском подходе задаётся априорное распределение \( \mathcal{GP}(0, k(x, x')) \), а затем после наблюдения данных \( (X, \mathbf{y}) \) вычисляется апостериорное распределение. Для гауссовского шума \( \epsilon \sim \mathcal{N}(0, \sigma_n^2) \) апостериорное распределение в точке \( x_* \) имеет вид:
\[ f_ | X, \mathbf{y}, x_ \sim \mathcal{N}(\mu_, \sigma_^2) \]
где \[ \mu_ = \mathbf{k}_^T (K + \sigma_n^2 I)^{-1} \mathbf{y} \] \[ \sigma_^2 = k(x_, x_) - \mathbf{k}_^T (K + \sigma_n^2 I)^{-1} \mathbf{k}_* \]
Здесь \( \mathbf{k}_ \) — вектор ковариаций между \( x_ \) и всеми обучающими точками.
Классификация
Для задач классификации гауссовские процессы применяются через латентные функции. Вместо прямой моделирования меток классов используется скрытая функция \( f(x) \), которая затем преобразуется через сигмоидную или probit-функцию для получения вероятностей классов. Вычисление апостериорного распределения в этом случае требует приближённых методов, таких как лапласовское приближение или вариационный вывод.
Оптимизация (байесовская оптимизация)
Гауссовские процессы являются ключевым компонентом байесовской оптимизации — метода глобальной оптимизации чёрных ящиков. Модель GP используется для аппроксимации целевой функции, а функция приобретения (например, ожидаемое улучшение или верхняя доверительная граница) определяет, в какой точке проводить следующую оценку. Этот подход эффективен для задач, где вычисление целевой функции дорого (например, настройка гиперпараметров нейронных сетей).
Свойства и ограничения
Преимущества
- Непараметричность: модель не фиксирует параметрическую форму функции, а адаптируется к данным.
- Оценка неопределённости: GP предоставляют доверительные интервалы для предсказаний.
- Гибкость: выбор ядра позволяет моделировать широкий класс функций.
Недостатки
- Вычислительная сложность: обучение требует инвертирования матрицы \( K \) размером \( n \times n \), что имеет сложность \( O(n^3) \). Для больших наборов данных (более нескольких тысяч точек) это становится непрактичным.
- Чувствительность к выбору ядра и гиперпараметров: неправильный выбор может привести к плохому обобщению.
- Трудности с многомерными данными: при большом числе признаков (более 20–30) эффективность GP снижается.
Приближённые методы
Для преодоления вычислительных ограничений разработаны приближённые методы:
- Разреженные гауссовские процессы: использование индуктивных точек (inducing points), которые аппроксимируют полную ковариационную матрицу.
- Вариационный вывод: приближение апостериорного распределения с помощью вариационных методов.
- Стохастические градиентные методы: минибатчи для обучения на больших данных.
Примеры использования
- Геостатистика: моделирование пространственных данных, таких как залежи полезных ископаемых или загрязнение воздуха.
- Робототехника: обучение динамике роботов и планирование движений.
- Финансы: моделирование временных рядов и оценка рисков.
- Биоинформатика: предсказание свойств белков и генной экспрессии.
Интересные факты
- Гауссовские процессы являются частным случаем более общего класса — процессов с независимыми приращениями, к которым также относится винеровский процесс.
- В русскоязычной литературе термин «гауссовский процесс» часто используется как синоним «нормального процесса», хотя в строгом смысле гауссовский процесс — это случайный процесс, а не распределение.
- Метод кригинга, широко используемый в геостатистике, математически эквивалентен регрессии на основе гауссовских процессов.
Источники
- Rasmussen, C. E., & Williams, C. K. I. (2006). Gaussian Processes for Machine Learning. MIT Press.
- Колмогоров, А. Н. (1941). Основные понятия теории вероятностей. ОНТИ.
- Bishop, C. M. (2006). Pattern Recognition and Machine Learning. Springer.
- MacKay, D. J. C. (2003). Information Theory, Inference, and Learning Algorithms. Cambridge University Press.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →


