i
Новости
Новости · 2026-10-01

ИИ обыграл сильнейшего игрока в Stratego, покончив с одним из последних оплотов людей в настольных играх

@neuronium_ai @neuronium_ai

Команда Carnegie Mellon University, New York University, Stanford University и MIT создала Ataraxos — первую, по оценке авторов, систему ИИ, достигшую сверхчеловеческого уровня в Stratego. В официальной серии из 20 партий она обыграла нидерландского игрока Пима Неймеера: одержала 15 побед, потерпела одно поражение и четыре партии свела вничью. На обучение Ataraxos, по подсчётам исследователей, ушло меньше $8 000 — значительно меньше, чем на прежнюю систему DeepMind.

Обложка: ИИ обыграл сильнейшего игрока в Stratego, покончив с одним из последних оплотов людей в настольных играх

Неймеер считается самым титулованным игроком в истории Stratego. Он четырежды становился чемпионом мира, 15 раз выигрывал чемпионат Нидерландов и дважды — онлайн-чемпионат мира. Более 600 недель он возглавлял мировой рейтинг. Джордж Франка, единственный участник всех чемпионатов мира с 1997 года, считает Неймеера сильнейшим игроком в Stratego за всё время.

В Stratego у каждого игрока 40 фигур, которые перед началом партии расставляют лицом вниз. По данным статьи в Nature, возможны более 10^33 вариантов начальной расстановки. В играх с неполной информацией ценность хода зависит не только от дальнейшего развития партии, но и от того, что происходило до и во время принятия решения, написал в X первый автор работы Сэмюэл Сокота.

Методы, заимствованные из ИИ для покера, помогли справиться с этой проблемой, но только при небольшом количестве скрытой информации. В техасском холдеме, например, существует 1 326 возможных начальных рук. Согласно статье, вычислительные затраты таких методов растут вместе с объёмом скрытой информации. Поэтому Stratego оставалась одной из последних крупных соревновательных настольных игр, в которых люди превосходили ИИ.

Меньше вычислений, чем у DeepMind

DeepMind уже пыталась превзойти сильнейших людей в Stratego, но не смогла. По данным статьи, система DeepNash обучалась на 1 024 узлах TPU в течение двух-трёх месяцев. Один из авторов работы о DeepNash вспоминал об этих сроках. Исследователи Ataraxos оценивают стоимость такого обучения в $3–4,5 млн в ценах 2025 года.

Ataraxos обучалась неделю на 16 видеокартах Nvidia H100, а затем ещё четыре дня — на четырёх видеокартах для так называемой сети убеждений. В ценах 2025 года общие затраты составляют менее $8 000. Исследователи оценивают вычислительную стоимость примерно в 1/500 от затрат на DeepNash, число партий игры системы против самой себя — в 1/30, а число обучающих примеров — в 1/100 от показателей DeepNash. Сократить затраты помогли написанный исследователями симулятор для GPU и более эффективное использование обучающих примеров. По словам Сокоты, команда располагала только академическими вычислительными ресурсами и за годы работы накопила множество приёмов.

Напрямую сравнить две системы не удалось. Исследователи предложили создать необходимую инфраструктуру, но DeepMind ответила, что это невозможно: код DeepNash больше не работает. На чемпионате мира 2023 года DeepNash выиграла 19 из 28 партий, но уступила большинству ведущих игроков, включая Неймеера.

Как Ataraxos учится менять стратегию

Ataraxos учится без человеческих данных, играя только против самой себя. По словам авторов, важную роль играет то, насколько сильно система во время обучения должна менять тактику. Дополнительное условие заставляет ИИ разнообразить расстановки и ходы, вместо того чтобы рано закрепиться на одной стратегии. Этот приём называется регуляризацией. В Stratego он важен, поскольку сильная игра требует случайности, а предсказуемого соперника можно использовать.

По мере обучения исследователи ослабляют это ограничение и соответствующим образом меняют размер шагов обучения. В начале Ataraxos часто меняет игру и учится крупными шагами. Позже она действует осмотрительнее и вносит небольшие поправки. Это помогает избежать бесконечного хождения по кругу и хаотичного поведения, характерных для игр с неполной информацией. Авторы сравнивают регуляризацию с запасом энергии: если ИИ израсходует его слишком быстро, он быстро продвинется в начале, но затем утратит способность учиться и станет уязвимым для противника.

В Ataraxos также используется сеть убеждений: она предсказывает, какие скрытые фигуры есть у соперника. Перед каждым ходом ИИ с её помощью строит возможные состояния игры, проверяет варианты хода и выполняет дополнительный шаг обучения для конкретного решения. Авторы отмечают, что в прежних работах от такого поиска отказывались, считая его слишком сложным при большом объёме скрытой информации.

Оба игрока тайно расставляют свои фигуры. Ранг фигуры раскрывается только тогда, когда она сталкивается с фигурой противника. Побеждает тот, кто захватит флаг противника

Оба игрока тайно расставляют свои фигуры. Ранг фигуры раскрывается только тогда, когда она сталкивается с фигурой противника. Побеждает тот, кто захватит флаг противника

Источник: the-decoder.com

Победа с исходным ограничением

Серию против Неймеера растянули на три недели, чтобы он не уставал и успевал готовиться. Он знал, что Ataraxos не будет подстраиваться под его стиль. За участие игрок получил $1 000, а также по $100 за победу и по $50 за ничью — у него был финансовый стимул играть как можно лучше.

По подсчётам авторов, эффективная доля побед Ataraxos составила 85%, если считать ничью за половину победы. Исследователи пишут, что такой результат беспрецедентен на высшем уровне. Макс Рулофс, трижды занимавший второе место на чемпионате мира, отмечает, что среди сильнейших игроков разница очень мала: игра вынуждает участников рисковать.

У ИИ было и структурное ограничение. Неймеер мог подстраиваться под Ataraxos на протяжении серии, а система не могла подстроиться под него. По данным статьи, трёхкратный чемпион мира Винсент де Бур считает это серьёзным недостатком.

На показательной серии во время чемпионата мира по Stratego 2025 года Ataraxos также выиграла 38 из 40 партий у участников турнира. Игроки описывают её стиль как трудный для чтения. ИИ идёт на блеф, который люди считают слишком рискованным, а при отставании упрямо затягивает игру — некоторым соперникам это кажется грубым. Система кажется почти неправдоподобно удачливой: её фигуры будто бы всегда оказываются в нужном месте. Партии против Неймеера доступны в интернете.

Метод применили и в других играх

Исследователи использовали тот же метод для создания систем и в других играх. В варианте Stratego под названием Barrage их ИИ выиграл четыре серии по 50 партий у трёх из четырёх игроков с наивысшим рейтингом. Все трое дважды становились чемпионами мира по Barrage. В кооперативной карточной игре Hanabi система установила новые рекорды во всех вариантах, а в версии для двух игроков использовала в сто раз меньше вычислительных ресурсов, чем прежняя лучшая система. В китайской карточной игре Dou dizhu она победила системы PerfectDou и DouZero, ранее служившие основными бенчмарками.

Авторы считают, что большой объём скрытой информации больше не является непреодолимым препятствием для обучения с подкреплением и поиска. Это может сделать практическое применение ИИ доступным во многих стратегических задачах, если для них удастся создать быстрые и точные симуляторы. В статье в качестве примеров названы финансовые рынки, военные конфликты и переговоры — ситуации с неполной информацией.

У метода есть ограничение: поиск имитирует только один шаг обучения, поэтому простое увеличение времени вычислений не позволит постоянно улучшать результат. По словам исследователей, это может измениться, если использовать более сложный метод поиска. Код Ataraxos команда опубликовала в открытом доступе.

Satlyt, основанная бывшим продакт-менеджером Google и SpaceX, привлекла $8 млн на запуск ИИ на спутниках OpenAI пресекла кампанию по краже рассуждений своих моделей, но на Azure уловка сработала Аналитики предупреждают: дата-центры могут стать бомбой замедленного действия на $6 трлн Как старейший ИИ-стартап пытается защитить себя от пузыря изнутри ИИ научился «читать мысли» и восстанавливать увиденное по снимкам мозга ИИ-чат-боты снимают хиджабы с изображений мусульманок по просьбе пользователей Забудьте о «сверхразуме»: из-за ошибки ИИ в этом месяце мир едва не оказался на пороге третьей мировой войны Barclays масштабирует Claude, чтобы модернизировать работу и улучшить обслуживание клиентов Знакомьтесь: робот, который заботится о 74-летней Вере у неё дома Голосовой ИИ-стартап ElevenLabs удвоил оценку — до $22 млрд Как ИИ может резко усилить угрозы выборам в Юго-Восточной Азии Новые товарные рекомендации Instinct вызывают у части пользователей отторжение Гэвин Ньюсом подписал законы, защищающие работников Калифорнии от угрозы ИИ Глава хедж-фонда пожертвовал Carnegie Mellon University $3 млрд — исторический дар Секрет Destro AI — согласовать работу людей и роботов Защита ИИ тормозит разработчиков Valor, Atreides и Sequoia вложились в ИИ-стартап Flow Engineering при оценке в $750 млн Google представила Gemini 4 Argon и вернула лидерство в бенчмарках у OpenAI и Anthropic — пока доступ ограничен Глава Банка Англии: на фоне растущей угрозы нужно сохранить право вмешиваться в работу ИИ OpenAI и Synopsys создают ИИ-модель, которая проектирует чипы на уровне опытного инженера

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram