NeFut Logo NeFut
EN 管理员登录

[AI学术] 在《Legends of Code and Magic》中使用策略与价值网络的非保守搜索

发布于:2026-09-11 22:00 最后更新:2026-09-12 06:35
#algorithm #AI #Machine Learning

决策时搜索在完美信息和不完美信息游戏中已被证明是有效的 AI 手段。可收集卡牌游戏属于不完美信息游戏,信念状态空间极大,Legends of Code and Magic(LoCM)的信念状态数为 $2^{101}$。LoCM 冠军 ByteRL 完全不使用搜索,已有工作认为基于枚举的保守搜索在此类游戏中不可行。我们测量了三项先前定义的属性,这些属性能够预测在理论上不保守的完美信息 Monte Carlo 缺陷何时代价低廉,结果表明 LoCM 位于有利区间。

我们先对亚军策略 NeteaseOPD 进行模仿学习,得到一个前馈策略网络和价值网络。代理在对手卡组的先验分布上抽样生成若干可能的世界进行搜索,该先验由亚军的选卡过程构建。使用最严格的战斗阶段配置进行搜索后,代理在官方裁判和时间限制下的 10,000 场预注册对局中以 51.35%(95% CI $[50.37, 52.33]$)的胜率击败 ByteRL。

搜索对本次对局影响显著:未使用搜索时胜率仅为 26.8%,加入搜索后提升约 24.6 个百分点。虽然不完美信息游戏中的非保守搜索可能被利用,但我们复现了针对 ByteRL 的已发表最佳响应攻击,并将同样的攻击流程应用于我们两种搜索配置的代理。结果显示,无论攻击迭代多少次,我们的代理均比 ByteRL 更具抗性。

在 LoCM 中,非保守搜索不仅提升了实力,还增强了对手攻击的鲁棒性。

点评:本研究展示了在信念空间极大的卡牌游戏中,结合策略/价值网络的非保守搜索能够显著提升 AI 表现,并在安全性上优于传统无搜索基线。

原文链接: https://arxiv.org/abs/2609.06816

[h] 返回首页