Открыть сервис

FRIDAY

FRIDAY — это компьютерная программа, созданная компанией DeepMind (принадлежит Alphabet Inc., материнской компании Google) и предназначенная для игры в стратегическую настольную игру го. FRIDAY стала первой программой, которая смогла обыграть действующего чемпиона мира по го Ли Седоля (Lee Sedol) в официальном матче, состоявшемся в марте 2016 года. Это событие считается одним из ключевых прорывов в области искусственного интеллекта (ИИ), поскольку игра го долгое время считалась значительно более сложной для компьютеров, чем шахматы, из-за огромного количества возможных ходов и необходимости интуитивного понимания позиции.

История создания

Предпосылки

До середины 2010-х годов компьютерные программы для игры в го значительно уступали сильнейшим игрокам-людям. В отличие от шахмат, где в 1997 году программа Deep Blue обыграла Гарри Каспарова, в го количество возможных позиций (около 10^170) делало невозможным полный перебор вариантов. Лучшие программы того времени, такие как Crazy Stone и Zen, использовали методы Монте-Карло с деревом поиска (MCTS), но их сила обычно оценивалась на уровне сильных любителей (около 5-6 дана), а не профессионалов высшего уровня.

Разработка в DeepMind

Компания DeepMind, основанная в 2010 году и приобретённая Google в 2014 году, поставила цель создать программу, способную превзойти человека в го. Разработка велась под руководством Демиса Хассабиса, Дэвида Сильвера и Аджи Хуанга. В отличие от традиционных подходов, основанных на эвристиках и ручном программировании правил, DeepMind применила методы глубокого обучения с подкреплением.

Программа обучалась в два этапа:

  1. Обучение с учителем: нейронная сеть (политическая сеть) училась предсказывать ходы, которые делают сильные игроки-люди, на основе базы данных из миллионов партий, сыгранных профессионалами.
  2. Обучение с подкреплением: программа играла сама с собой, постоянно улучшая свою стратегию. Для этого использовались две нейронные сети: политическая сеть (выбирает ходы) и ценностная сеть (оценивает вероятность победы в данной позиции). Они объединялись с алгоритмом MCTS, который направлял поиск в наиболее перспективные варианты.

Первая версия программы, названная AlphaGo, в октябре 2015 года в закрытом матче обыграла чемпиона Европы по го Фань Хуэя (Fan Hui) со счётом 5:0. Это был первый случай, когда компьютерная программа обыграла профессионального игрока в го на равных условиях.

Матч с Ли Седолем

В марте 2016 года в Сеуле (Южная Корея) состоялся пятипартийный матч между AlphaGo и Ли Седолем — одним из величайших игроков в го всех времён, обладателем 18 мировых титулов. Матч транслировался в прямом эфире и привлёк внимание миллионов зрителей по всему миру.

AlphaGo одержала победу со счётом 4:1. Единственное поражение (в четвёртой партии) стало результатом нестандартного хода Ли Седоля (ход 78), который вывел программу из равновесия и заставил её совершить серию ошибок. Этот матч продемонстрировал, что ИИ способен не только копировать человеческие стратегии, но и находить новые, нестандартные решения.

Архитектура и принципы работы

Нейронные сети

AlphaGo использует две основные нейронные сети:

  • Политическая сеть (Policy Network): принимает на вход текущее состояние доски (позицию) и выдаёт вероятностное распределение по всем возможным ходам. Она обучена предсказывать, какой ход с наибольшей вероятностью сделает сильный игрок. Это позволяет резко сократить количество вариантов для анализа.
  • Ценностная сеть (Value Network): оценивает позицию, выдавая одно число — вероятность победы текущего игрока. Она помогает программе понять, насколько выгодна или невыгодна та или иная позиция без необходимости полного просчёта.

Дерево поиска Монте-Карло (MCTS)

AlphaGo не просто полагается на нейронные сети, а использует их в сочетании с алгоритмом MCTS. В каждом узле дерева поиска программа:

  1. Выбирает ход, который максимизирует некоторую функцию (например, баланс между исследованием новых вариантов и использованием уже известных хороших).
  2. Если позиция не была посещена ранее, она оценивается с помощью ценностной сети, а также политическая сеть предлагает список возможных ходов.
  3. Результаты симуляций (игр до конца) и оценки ценностной сети распространяются обратно по дереву, обновляя статистику.

Этот гибридный подход позволяет AlphaGo эффективно исследовать огромное пространство состояний, не теряя времени на заведомо плохие ходы.

Оборудование

Для матча с Ли Седолем AlphaGo использовала распределённую вычислительную систему. Она работала на 1920 процессорах (CPU) и 280 графических процессорах (GPU). Впоследствии были созданы более эффективные версии, работающие на меньшем количестве оборудования.

Версии и развитие

AlphaGo Master

После матча с Ли Седолем DeepMind продолжила совершенствовать программу. В 2017 году была выпущена версия AlphaGo Master, которая в онлайн-матчах обыграла сильнейших игроков мира, включая Кэ Цзе (Ke Jie) — действующего чемпиона мира по го. AlphaGo Master использовала улучшенные алгоритмы обучения и более эффективные нейронные сети.

AlphaGo Zero

В октябре 2017 года DeepMind представила AlphaGo Zero — версию, которая полностью обучалась без использования данных о человеческих партиях. Она начинала с нуля, играя только сама с собой. Через 40 дней обучения AlphaGo Zero превзошла по силе все предыдущие версии, включая AlphaGo Master. Этот подход продемонстрировал, что ИИ может самостоятельно открывать стратегии, которые человечество вырабатывало тысячелетиями, а также находить принципиально новые.

AlphaZero

В декабре 2017 года была анонсирована AlphaZero — обобщённая версия алгоритма, способная обучаться не только го, но и шахматам, и сёги (японские шахматы). AlphaZero за несколько часов обучения превзошла лучшие программы в каждой из этих игр, не используя никаких специализированных знаний, кроме правил игры.

Значение и влияние

Для науки и технологий

Победа AlphaGo стала важной вехой в развитии искусственного интеллекта. Она показала, что методы глубокого обучения с подкреплением могут решать задачи, которые считались недоступными для компьютеров. Технологии, разработанные для AlphaGo, нашли применение в других областях, таких как:

  • Медицина: прогнозирование структуры белков (AlphaFold).
  • Робототехника: обучение роботов сложным движениям.
  • Энергетика: оптимизация работы дата-центров.

Для игры в го

AlphaGo изменила подход к игре в го. Профессиональные игроки начали анализировать партии программы, чтобы понять новые стратегии и идеи. Многие ходы, сделанные AlphaGo, оказались нестандартными и даже противоречили традиционным представлениям, но впоследствии были признаны эффективными. Это привело к пересмотру некоторых классических джосэки (стандартных последовательностей ходов) и общему повышению уровня игры.

Для общества

Матч AlphaGo с Ли Седолем привлёк широкое внимание к проблеме искусственного интеллекта. Он стал символом того, что ИИ может превзойти человека в интеллектуальных задачах, которые долгое время считались исключительно человеческой прерогативой. Это вызвало как восхищение, так и обеспокоенность по поводу будущего ИИ и его влияния на общество.

Критика и ограничения

Несмотря на впечатляющие результаты, AlphaGo имеет ряд ограничений:

  • Ограниченная область применения: программа способна играть только в го и не может быть напрямую перенесена на другие задачи без значительной модификации.
  • Отсутствие понимания: AlphaGo не «понимает» игру в человеческом смысле. Она действует на основе статистических закономерностей, а не логических рассуждений.
  • Зависимость от вычислительных ресурсов: ранние версии требовали огромных вычислительных мощностей, что делало их недоступными для широкого использования.

Интересные факты

  • Во время матча с Ли Седолем AlphaGo совершила ход 37 во второй партии, который был назван «божественным» комментаторами. Этот ход был настолько нестандартным, что сначала считался ошибкой, но впоследствии оказался ключевым для победы.
  • После матча Ли Седоль заявил, что игра против AlphaGo изменила его понимание го и что он стал играть иначе, вдохновляясь стилем программы.
  • В 2017 году DeepMind выпустила книгу «AlphaGo: The Movie», в которой подробно рассказала о создании программы и матче.

Источники

  • Silver, D., Huang, A., Maddison, C. J., et al. (2016). Mastering the game of Go with deep neural networks and tree search. Nature, 529, 484–489.
  • Silver, D., Schrittwieser, J., Simonyan, K., et al. (2017). Mastering the game of Go without human knowledge. Nature, 550, 354–359.
  • Silver, D., Hubert, T., Schrittwieser, J., et al. (2018). A general reinforcement learning algorithm that masters chess, shogi, and Go through self-play. Science, 362, 1140–1144.
  • Hassabis, D. (2016). The story of AlphaGo. DeepMind Blog.
  • Lee Sedol vs AlphaGo match records and commentary (2016). Korean Baduk Association.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →