
На протяжении почти трёх десятилетий компьютеры последовательно разрушали лучшие игровые тесты, созданные людьми. В 1997 году IBM Deep Blue победила чемпиона мира по шахматам Гарри Каспарова. В 2016 году AlphaGo победила мастера го Ли Седоля. Вскоре последовал покер, поскольку системы искусственного интеллекта научились не только рассчитывать шансы, но и блефовать против элитных профессионалов.
Стратего оказался гораздо сложнее. Каждый игрок командует 40 фигурами, личности которых скрыты от противника, и игра может охватывать сотни или даже тысячи ходов. Победа требует большего, чем просто смотреть вперед. Игроки должны сделать вывод, что скрывает другая сторона, решить, когда блефовать, и попрактиковаться, когда кажущаяся опасной фигура просто притворяется таковой.
Теперь исследователи говорят, что ИИ наконец-то превзошел лучших людей в игре. Система под названием «Атараксос» обыграла Пима Нимейера, четырехкратного чемпиона мира и одного из самых титулованных игроков «Стратего», со счетом 15 к одному, при четырех ничьих. Результат сообщается в новом Природа Исследование ознаменовало то, что исследователи называют первой демонстрацией сверхчеловеческой игры Стратего.
«В Stratego есть что-то настолько уникальное, что это огромное количество скрытой информации, которая раскрывается в течение очень длительного периода времени», — сказал Юджин Виницкий, соавтор исследования из Нью-Йоркского университета. Арс Техника.
Вся проблема в этой скрытой информации. Игроки знают, где находятся фигуры противника, но не знают, что они из себя представляют, пока их не обнаружит бой. У Stratego более 1033 (это число с 33 нулями) возможная стартовая конфигурация. И в отличие от шахмат, ценность хода может зависеть от того, что, по мнению оппонента, вы можете сделать, и от того, как часто вас раньше блефовали.
Научим ИИ делать обоснованные предположения
Атараксос начинается, как и любой другой игровой ИИ: он учится, постоянно играя против самого себя. Завершив более 163 миллионов игр, компания разработала «чертеж» стратегии расстановки и перемещения своих частей. Но исследователи также модулировали, насколько агрессивно система обновляла свою стратегию во время обучения, внося более крупные изменения раньше и более осторожно позже. Это помогло избежать нестабильных циклов обучения, которые могут возникнуть, когда ни один игрок не знает полного состояния игры.
Важное дополнение происходит во время игры. Перед каждым ходом вторая нейронная сеть оценивает возможные личности скрытых фигур противника. Атараксос пробует множество возможных сценариев, разыгрывает возможные ходы, а затем корректирует свой выбор, прежде чем действовать.
Важным достижением является то, что Атараксос не только может представить себе возможное будущее, но и может делать это, не поддаваясь огромной неопределенности Стратего. Ранние системы, такие как DeepNash компании DeepMind, в значительной степени избегали такого рода упреждающего прогнозирования, поскольку количество возможных скрытых состояний доски увеличивается слишком быстро.
Ataraxos делает этот процесс управляемым, ограничивая свои расчеты сценариями, которые он считает возможными. Это позволяет ему оценить несколько возможных продолжений, прежде чем совершить ход, а не полагаться исключительно на общую стратегию, которую он усвоил во время тренировки.
Результат может показаться пугающе спокойным. «Людям очень трудно, когда вы знаете секрет, принимать решения, игнорирующие тот факт, что вы знаете этот секрет», — говорит Габриэле Фарина из Массачусетского технологического института. Арс Техника. «Для машин это легко».
На чемпионате мира Stratego 2025 года «Атараксос» также выиграл у посетителей 38 из 40 демонстрационных игр. Та же самая общая стратегия дала лучшие результаты в Barrage Stratego, совместной карточной игре Hanabi и китайской карточной игре dou dizhu.
Более мощный плеер за меньшие вычислительные затраты
Заявленное превосходство может быть так же важно, как и победа над чемпионом. В ходе основного цикла обучения с подкреплением в течение недели использовалось 16 графических процессоров Nvidia H100; модель убеждений использовала четыре H100 еще четыре дня. По оценкам авторов, он потреблял около одной пятисотой вычислительной мощности, использованной для обучения DeepNash, включая примерно одну тридцатую часть игр для самостоятельной игры.
В прошлом Libratus побеждал лучших профессионалов покера в соревновании с участием 120 000 рук, показывая, что ИИ может справиться даже с играми со скрытой информацией. Атараксос переносит эту идею в обстановку, где скрытое состояние больше.
Атараксос показывает, что ИИ может лучше рассуждать в условиях неопределенности и в контролируемой среде. Гораздо более сложная проблема — сможет ли этот навык безопасно перемещаться по игровому полю. Переговоры, кибербезопасность и военное планирование гораздо сложнее, чем настольная игра, с меняющимися правилами, неполными моделями и последствиями, которые невозможно свести к победе или поражению.
Природа В самой статье говорится, что этот подход наиболее перспективен для задач, в которых исследователи могут создавать быстрые и точные симуляторы.
Система по-прежнему не может объяснить свои варианты так, чтобы человек, принимающий решения, мог их легко проверить. «Люди должны иметь последнее слово в том, будут ли выполняться рекомендации, поэтому, прежде чем произойдет принятие, нам нужен способ проверить решения модели», — сказал Фарина в Новости в Массачусетском технологическом институте. «Нам еще предстоит пройти долгий путь, но я надеюсь, что эти алгоритмы могут стать основой для гораздо большей работы».
