Открыть сервис

Gaussian

Gaussian — это семейство алгоритмов машинного обучения, основанных на использовании нормального (гауссовского) распределения для решения задач регрессии, классификации и кластеризации. Название происходит от имени немецкого математика Карла Фридриха Гаусса, чьи работы легли в основу теории нормального распределения и метода наименьших квадратов. В современном контексте термин «Gaussian» чаще всего относится к двум основным моделям: гауссовским процессам (Gaussian Processes, GP) и гауссовским смесям (Gaussian Mixture Models, GMM). Также существуют специализированные алгоритмы, такие как гауссовский наивный байесовский классификатор (Gaussian Naive Bayes) и гауссовская регрессия.

Основные типы алгоритмов Gaussian

Гауссовские процессы (Gaussian Processes)

Гауссовский процесс — это вероятностная модель, которая задаёт распределение по функциям. В отличие от многих других методов машинного обучения, GP не аппроксимирует целевую функцию параметрически, а определяет априорное распределение по всем возможным функциям, совместимым с данными. После наблюдения обучающих точек это распределение уточняется (апостериорное распределение), что позволяет делать предсказания с оценкой неопределённости.

Основные характеристики:

  • Непараметричность: модель не имеет фиксированного числа параметров; её сложность растёт с объёмом данных.
  • Ядро (kernel): ключевой элемент GP, определяющий корреляцию между точками данных. Популярные ядра: радиальная базисная функция (RBF), Матерна, периодическое ядро.
  • Применение: регрессия (например, прогнозирование временных рядов), оптимизация (байесовская оптимизация), классификация (через латентные переменные).

Преимущества: встроенная оценка неопределённости, хорошая работа на малых выборках, гибкость. Недостатки: вычислительная сложность O(n³) (где n — число точек), что ограничивает применение на больших данных.

Гауссовские смеси (Gaussian Mixture Models, GMM)

GMM — это вероятностная модель, представляющая распределение данных как взвешенную сумму нескольких нормальных распределений (компонент). Каждый компонент описывается средним значением и ковариационной матрицей. Модель используется для мягкой кластеризации, где каждая точка данных может принадлежать нескольким кластерам с разной вероятностью.

Основные характеристики:

  • Параметры: количество компонент K, веса (смесь), средние, ковариации.
  • Обучение: метод максимизации ожидания (EM-алгоритм), который итеративно оценивает скрытые переменные (принадлежность к компонентам) и обновляет параметры.
  • Ковариационные структуры: возможны варианты — полная (каждый компонент имеет свою ковариацию), диагональная, сферическая или связанная (общая для всех).

Преимущества: способность моделировать сложные многомодальные распределения, мягкая кластеризация, интерпретируемость. Недостатки: чувствительность к выбору начальных параметров, склонность к переобучению при большом числе компонент, необходимость заранее задавать K.

Гауссовский наивный байесовский классификатор (Gaussian Naive Bayes)

Это частный случай наивного байесовского классификатора, в котором предполагается, что признаки имеют нормальное распределение внутри каждого класса. Модель вычисляет апостериорную вероятность класса на основе априорной вероятности и функции правдоподобия, используя гауссовскую плотность.

Основные характеристики:

  • Предположение: признаки независимы при заданном классе (наивное допущение).
  • Параметры: для каждого класса и каждого признака оцениваются среднее и дисперсия.
  • Применение: классификация текстов, медицинская диагностика, фильтрация спама (при условии нормальности признаков).

Преимущества: простота, быстрота обучения, устойчивость к малым выборкам. Недостатки: сильное предположение о независимости признаков, которое редко выполняется на практике.

История развития

Идеи, лежащие в основе Gaussian-алгоритмов, имеют долгую историю. Нормальное распределение было впервые описано Абрахамом де Муавром в 1733 году, а затем систематизировано Карлом Фридрихом Гауссом в 1809 году в контексте метода наименьших квадратов. В 1820-х годах Пьер-Симон Лаплас развил теорию вероятностей, связав нормальное распределение с центральной предельной теоремой.

Гауссовские процессы как инструмент для регрессии были предложены в 1940-х годах в работах Андрея Колмогорова и Норберта Винера (фильтр Винера). Однако практическое применение GP в машинном обучении началось лишь в 1990-х годах после работ Карла Расмуссена и Кристофера Уильямса, которые опубликовали монографию «Gaussian Processes for Machine Learning» (2006). В России и СССР теория случайных процессов активно развивалась в 1950–1970-х годах, но практическое внедрение GP в анализ данных произошло позже.

Гауссовские смеси были формализованы в 1960-х годах, а EM-алгоритм для их обучения был предложен Артуром Демпстером, Наном Лэрдом и Дональдом Рубином в 1977 году. В России GMM применялись в задачах распознавания речи и обработки сигналов с 1980-х годов.

Применение

Регрессия и прогнозирование

Гауссовские процессы широко используются в задачах, где важна оценка неопределённости: прогнозирование погоды, моделирование климата, анализ финансовых временных рядов, робототехника (планирование траекторий). В России GP применяются в геофизике для интерполяции данных сейсморазведки.

Кластеризация и сегментация

GMM применяются в маркетинге для сегментации клиентов, в компьютерном зрении для сегментации изображений, в биоинформатике для анализа экспрессии генов. В России GMM используются в системах видеонаблюдения для выделения движущихся объектов на фоне.

Классификация

Гауссовский наивный байесовский классификатор применяется в системах фильтрации спама, диагностике заболеваний (например, по медицинским анализам), распознавании рукописного текста. В России этот метод используется в некоторых банковских системах для оценки кредитного риска.

Байесовская оптимизация

Гауссовские процессы являются основой байесовской оптимизации — метода поиска экстремума функций, которые дорого вычислять (например, настройка гиперпараметров нейросетей, проектирование химических реакций). Этот подход применяется в российских исследовательских центрах, таких как Сколтех и МФТИ.

Критика и ограничения

Основные недостатки Gaussian-алгоритмов связаны с вычислительной сложностью и предположениями о данных. Гауссовские процессы требуют O(n³) операций, что делает их неприменимыми для больших выборок без аппроксимаций (например, разреженные GP). GMM чувствительны к выбору числа компонент и начальных параметров, что может приводить к локальным оптимумам. Гауссовский наивный байесовский классификатор страдает от сильного предположения о независимости признаков, которое редко выполняется в реальных данных.

Кроме того, все модели предполагают нормальность распределения ошибок или признаков, что не всегда соответствует действительности. В таких случаях требуется предварительная трансформация данных (например, логарифмирование) или использование робастных вариантов.

Сравнение с другими методами

ПараметрGaussian ProcessesGaussian Mixture ModelsGaussian Naive Bayes
Тип задачиРегрессия, классификацияКластеризация, плотностьКлассификация
Оценка неопределённостиДаНет (только вероятности)Да (апостериорные вероятности)
Вычислительная сложностьO(n³)O(n·K·d)O(n·d)
ПредположенияГладкость (через ядро)МногомодальностьНезависимость признаков
Применение в РоссииГеофизика, оптимизацияСегментация, видеоанализСпам-фильтры, кредитный риск

Интересные факты

  • Гауссовские процессы используются в автономных автомобилях для моделирования дорожной обстановки и оценки рисков столкновений.
  • GMM лежат в основе системы распознавания речи в голосовых помощниках (например, «Алиса» от Яндекса).
  • В 2023 году российские учёные из Института проблем передачи информации РАН предложили модификацию GP для анализа данных с космических телескопов.
  • Гауссовский наивный байесовский классификатор часто используется в учебных курсах по машинному обучению в российских вузах (МГУ, ВШЭ) как первый пример вероятностной модели.

Источники

  1. Rasmussen, C. E., & Williams, C. K. I. (2006). Gaussian Processes for Machine Learning. MIT Press.
  2. Bishop, C. M. (2006). Pattern Recognition and Machine Learning. Springer.
  3. Демпстер, А., Лэрд, Н., Рубин, Д. (1977). «Maximum Likelihood from Incomplete Data via the EM Algorithm». Journal of the Royal Statistical Society.
  4. Учебные материалы курса «Машинное обучение» МФТИ, 2022.
  5. Публикации Института проблем передачи информации РАН, 2023.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →