MIT、卡内基梅隆、纽约大学和斯坦福的研究团队利用机器学习最新进展,开发出一种名为 Ataraxos 的 AI 系统,能够在信息不完全的棋盘游戏 Stratego 中以大幅优势击败顶尖人类选手。Stratego 是一种两人对弈的游戏,双方的棋子身份在未碰撞前保持隐藏,可能的棋子布局超过 $10^{66}$,远超象棋的组合空间,因而对 AI 的推理能力提出了极高要求。\ \ Ataraxos 采用两阶段方法:首先通过自我对弈的强化学习(self‑play reinforcement learning)训练出一套“蓝图策略”,该过程使用了专门设计的高效算法,使得所需的训练样本仅为 DeepNash 的千分之一,自我对弈局数仅为三十分之一,从而显著降低计算成本。随后在实际对局中,系统在每一步利用决策时规划(decision‑time planning)对蓝图策略进行即时微调。具体做法是构建一个生成模型,根据对手可能的隐藏棋子身份分布进行概率估计,并在此基础上评估若干候选走法,最终选取期望收益最高的动作。\ \ 这种生成式的决策时规划是 Ataraxos 超越以往系统的关键。实验结果显示,Ataraxos 在世界锦标赛中以 15 胜 1 平 4 负的纪录击败了当时排名第一的选手,并在对阵顶尖人类玩家的整体赛程中取得 39 胜 2 负的成绩。相比之下,DeepMind 的 DeepNash 在相同任务上仍未能实现超人水平。\ \ 研究团队还将 Ataraxos 移植到其他不完全信息游戏,如变体 Barrage Stratego、合作卡牌游戏 Hanabi 以及三人斗地主(Dou dizhu),均取得了超人表现,证明了方法的通用性。未来工作将聚焦于为系统加入可解释性模块,使其决策过程能够被人类审计和理解,从而在商业谈判、网络安全等真实场景中提供可靠的辅助。\ \ 点评:Ataraxos 展示了在隐藏信息环境下高效学习与实时规划的结合路径,为 AI 在复杂决策领域的落地提供了可行范式。