Обучение с подкреплением¶
Обучение с подкреплением (англ. reinforcement learning, RL) — раздел машинного обучения, в котором агент обучается взаимодействовать со средой, стремясь максимизировать совокупную награду. В отличие от обучения с учителем, где модель обучается на готовых парах «вход-выход», и обучения без учителя, где ищутся скрытые закономерности в данных, RL предполагает активное исследование среды и получение обратной связи в виде скалярного сигнала вознаграждения. Этот подход моделирует процесс научения методом проб и ошибок, характерный для биологических систем и лежащий в основе многих современных достижений искусственного интеллекта.
¶Основные понятия и формализация
Формальной основой большинства задач RL является марковский процесс принятия решений (MDP). MDP описывается кортежем из пяти элементов: множества состояний среды, множества действий агента, функции переходов между состояниями, функции вознаграждения и коэффициента дисконтирования. Агент, находясь в состоянии, выбирает действие, после чего среда переходит в новое состояние и возвращает агенту численное вознаграждение. Цель агента — найти такую стратегию (политику), которая максимизирует ожидаемую сумму дисконтированных будущих наград.
Ключевым понятием является функция ценности — оценка ожидаемой будущей награды из данного состояния (или пары «состояние-действие») при следовании определённой политике. Оптимальная политика — та, что максимизирует функцию ценности во всех состояниях. Для её поиска используются уравнения Беллмана, связывающие ценность текущего состояния с ценностью последующих.
¶Классификация методов
Методы RL принято делить на несколько категорий по различным признакам.
¶Model-based и model-free методы
Model-based методы предполагают построение модели среды — аппроксимации функций переходов и вознаграждения. Агент может «проигрывать» в уме возможные сценарии (планирование) и использовать эту модель для оптимизации политики. Такие подходы, как алгоритм AlphaZero, эффективны при ограниченном взаимодействии с реальной средой, но требуют точной модели.
Model-free методы не строят модель среды и обучаются непосредственно на опыте взаимодействия. Они делятся на два подкласса:
- Value-based методы (например, Q-learning) оценивают функцию ценности действий и выбирают действие с максимальной оценкой. Классическим примером является алгоритм Deep Q-Network (DQN), использующий глубокие нейронные сети для аппроксимации Q-функции.
- Policy-based методы (например, REINFORCE) напрямую оптимизируют параметризованную политику, часто с использованием градиента политики. Они лучше работают в пространствах непрерывных действий и со стохастическими политиками.
Гибридные actor-critic методы сочетают оба подхода: актор (actor) обновляет политику, а критик (critic) оценивает её ценность, снижая дисперсию градиентных оценок. Современные алгоритмы, такие как Proximal Policy Optimization (PPO) и Soft Actor-Critic (SAC), относятся именно к этой категории.
¶On-policy и off-policy обучение
В on-policy методах (например, SARSA, PPO) агент обучается только на данных, собранных текущей политикой. В off-policy методах (Q-learning, DQN, SAC) используется опыт, порождённый другими политиками, что позволяет применять буфер воспроизведения (replay buffer) и повышает эффективность использования данных.
¶Ключевые алгоритмы и их развитие
Исторически значимым алгоритмом является Q-learning, предложенный Кристофером Уоткинсом в 1989 году. Он относится к off-policy методам и сходится к оптимальной политике при выполнении условий обучения. В 2013 году команда DeepMind представила DQN, который обучился играть в игры Atari на уровне человека, используя только пиксели экрана в качестве входных данных. Это стало прорывом, продемонстрировавшим сочетание глубокого обучения и RL.
Дальнейшее развитие привело к созданию алгоритмов, решающих проблемы переоценки ценностей (Double DQN), распределения опыта (Prioritized Experience Replay) и обучения в распределённой среде (Ape-X, R2D2). В области непрерывного управления широко применяются методы градиента политики. Алгоритм Trust Region Policy Optimization (TRPO) и его упрощённая версия PPO обеспечивают стабильность обучения за счёт ограничения размера обновления политики. SAC добавляет энтропийную регуляризацию, поощряя исследование среды.
Отдельного упоминания заслуживает семейство алгоритмов AlphaGo, AlphaZero и MuZero, разработанных в DeepMind. AlphaZero использует самообучение и поиск по дереву Монте-Карло, обучаясь игре в го, шахматы и сёги без каких-либо человеческих знаний, кроме правил. MuZero расширяет этот подход, обучаясь модели среды, что позволяет применять его в задачах с неизвестной динамикой.
¶Применение
Обучение с подкреплением находит применение в широком спектре областей.
¶Робототехника
RL используется для обучения роботов сложным двигательным навыкам: ходьбе, манипуляции объектами, сборке. Обучение часто проводится в симуляторах с последующим переносом навыков на реальные устройства (sim-to-real transfer). Этот подход позволяет избежать дорогостоящих и опасных экспериментов на реальном оборудовании.
¶Игры и симуляции
Помимо классических настольных игр, RL применяется для создания ботов в компьютерных играх (например, OpenAI Five в Dota 2, AlphaStar в StarCraft II) и для управления автономными транспортными средствами в симуляторах. Достижения в играх служат бенчмарками для оценки новых алгоритмов.
¶Промышленность и логистика
Алгоритмы RL используются для оптимизации цепочек поставок, управления запасами, планирования производства и маршрутизации транспорта. Например, компания Amazon применяет RL для оптимизации логистических операций, а в энергетике — для управления потреблением и распределением электроэнергии.
¶Финансы и здравоохранение
В финансах RL применяется для алгоритмической торговли, управления портфелем активов и оптимизации торговых стратегий. В медицине — для подбора схем лечения, персонализированной терапии и оптимизации клинических испытаний. Однако в этих областях применение ограничено требованиями к интерпретируемости и безопасности решений.
¶Рекомендательные системы
RL используется для построения рекомендательных систем, которые учитывают долгосрочную вовлечённость пользователей, а не только немедленные клики. Агент обучается предлагать контент, максимизируя совокупное время взаимодействия или другие метрики удержания.
¶Проблемы и ограничения
Несмотря на успехи, RL сталкивается с рядом фундаментальных проблем.
Проблема исследования и эксплуатации (exploration-exploitation dilemma) заключается в необходимости баланса между исследованием неизвестных областей среды и использованием уже известных выгодных стратегий. Простые эвристики, такие как ε-жадная стратегия, часто неэффективны в сложных средах.
Разреженность вознаграждения — ситуация, когда агент получает ненулевой сигнал только после длинной последовательности действий. Это делает обучение крайне медленным. Для решения применяются методы формирования вознаграждения (reward shaping), обучение с демонстрациями и иерархический RL.
Нестабильность обучения возникает из-за корреляции между последовательными сэмплами опыта и изменениями распределения данных. Методы буфера воспроизведения и целевых сетей лишь частично решают эту проблему.
Обобщение и перенос — обученные политики часто плохо переносятся на новые, даже слегка изменённые условия. Достижение обобщения, сравнимого с человеческим, остаётся открытой проблемой.
Безопасность — в реальных приложениях ошибки агента могут привести к нежелательным последствиям. Разработка методов безопасного RL, учитывающих ограничения и гарантии, является активной областью исследований.
¶Перспективы развития
Современные исследования в области RL направлены на повышение эффективности обучения, развитие методов обучения с подкреплением на основе обратной связи от человека (RLHF), которое используется при обучении больших языковых моделей, таких как ChatGPT. Также развиваются направления мультиагентного обучения, метаобучения (обучение обучению) и RL в частично наблюдаемых средах. Интеграция RL с другими парадигмами машинного обучения, включая обучение на основе моделей мира, открывает путь к созданию более автономных и адаптивных систем искусственного интеллекта.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →

