MIT、卡内基梅隆大学(CMU)、纽约大学和斯坦福的研究者 9 月 30 日在《自然》(Nature)发表论文,介绍了一个叫 Ataraxos 的 AI 系统。它在策略棋类游戏 Stratego 上以 15 胜 1 负 4 平打赢了 Pim Niemeijer,后者被称为这项游戏历史上战绩最辉煌的人类选手。
成本低得出奇。按论文给出的配置,强化学习模型用 16 张 H100 训练了 1 周,用来推测对手棋子身份的信念模型用 4 张 H100 训练了 4 天,按 2025 年的价格算,总开销不到 8000 美元。
Stratego 难在哪
Stratego 是一款两人对弈的军棋类游戏,双方各有 40 枚棋子,开局时棋子背面朝向对手,谁是司令、谁是炸弹、军旗藏在哪,对方都看不见,只有交战时才翻开。研究团队估算,可能的棋子布局超过 10 的 66 次方种。
这和围棋、国际象棋不同。那两类是完全信息游戏,棋盘上一切都摆在明面上。Stratego 需要一边猜对手的底牌,一边控制自己透露多少信息,还要会虚张声势。这类不完全信息博弈和谈判、拍卖、网络攻防这些现实问题在结构上更接近,也是 AI 研究长期的难点。
论文资深作者、MIT 电子工程与计算机系的 Gabriele Farina 这样描述 Ataraxos 的打法:
“Ataraxos is good at calculating risk in a way that humans are not… doesn’t overcorrect and give away its secrets.”
(Ataraxos 计算风险的方式人类做不到……它不会矫枉过正,也不会把自己的底细暴露出去。)
和 DeepNash 放在一起看
Stratego 上的上一个标杆是 DeepMind 2022 年的 DeepNash。它靠大规模自我对弈训练,在 Stratego 在线平台 Gravon 上排进了历史前三,当时被看作 AI 攻下这款游戏的标志。
Ataraxos 的路子不一样。它在训练之外加了决策时规划,也就是每到一步,先基于对对手棋子的推测做一轮搜索,再落子。研究者的说法是,它不盲猜,会在所有可能的局面里找最稳妥的走法。
把两者的训练开销放在一起:
| 指标 | Ataraxos 相对此前工作 |
|---|---|
| 强化学习训练算力成本 | 约 1/500 |
| 自我对弈局数 | 约 1/30 |
| 训练样本数 | 约 1/100 |
成绩上,除了对 Niemeijer 的 15-1-4,Ataraxos 对阵世界锦标赛级别顶尖选手的总战绩是 39 胜 2 负。
从 AlphaGo 到 DeepNash,大实验室过去几年的博弈 AI 成果,往往和几千张芯片、几个月训练绑在一起,高校团队很难跟进。Ataraxos 把同一类问题的训练账单压到一张中等规模研究经费就能覆盖的程度,说明在这类问题上,推理阶段的搜索可以替代大量训练阶段的堆算力。这和大模型领域这两年”把算力从训练挪到推理”的思路是同一个方向。
论文署名作者包括 CMU 的 Samuel Sokota(第一作者)、Zico Kolter,MIT 的 Gabriele Farina、Zhiyuan Fan,纽约大学的 Eugene Vinitsky 和斯坦福的 Hengyuan Hu。代码和模型权重是否开放、在别的不完全信息游戏上表现如何,MIT 的新闻稿里没有说明,后续以论文补充材料和作者发布为准。
参考来源:《自然》论文、MIT 新闻办公室、Tech Xplore、CocoLoop;论文核验训练配置、成本口径与对局战绩,DeepNash 对比数据以论文所述为准。