我们推出 CivBench,一个开源基准,用于评估语言模型代理在长期、工具介导环境中的表现,评测遵循 Model Context Protocol (MCP)。
单局游戏超过 300 回合,在庞大的动作空间内产生 数千次工具调用,要求代理持续规划、监控状态,并在部分可观测条件下执行动作。
环境公开 76 种 MCP 工具,并提供叙事层,将可视化的游戏状态转换为结构化文本供模型使用。
我们在 四类模型 上进行 23 次可接受运行 的行为特征分析。该实验是一次 试点,并非模型排名;聚合结果在此规模下并不能可靠地区分模型。
为量化接口层表现,提出两项度量:
- 主动监控率 (PMR):衡量代理是否主动查询潜在的战略状态;
- RAG@10:衡量在结构化规划反思中声明的承诺是否在随后 10 回合 内得到执行。
实验中观察到两条一致模式:
- 监控不足:尽管手册要求每 20 回合 查询一次胜利进度,代理实际查询间隔为 30‑75 回合;在 20 回合 警告窗口内未查询导致 7/20 可检测的失败。
- 承诺执行率低:代理经常未兑现近期规划承诺,RAG@10 在 48.2%‑65.8% 之间波动。
这些现象即使在提供工具访问和明确指导的情况下仍然出现,我们将其解释为 指令偏差 而非能力缺失。
环境、场景、日志、度量以及分析流水线已在 GitHub 开源:https://github.com/lmwilki/civ6-mcp
点评