NeFut Logo NeFut
EN 管理员登录

[AI学术] CivBench:文明VI中面向工具的长期代理基准

发布于:2026-09-03 22:00 最后更新:2026-09-04 02:14
#AI #Machine Learning #LLM

我们推出 CivBench,一个开源基准,用于评估语言模型代理在长期、工具介导环境中的表现,评测遵循 Model Context Protocol (MCP)

单局游戏超过 300 回合,在庞大的动作空间内产生 数千次工具调用,要求代理持续规划、监控状态,并在部分可观测条件下执行动作。

环境公开 76 种 MCP 工具,并提供叙事层,将可视化的游戏状态转换为结构化文本供模型使用。

我们在 四类模型 上进行 23 次可接受运行 的行为特征分析。该实验是一次 试点,并非模型排名;聚合结果在此规模下并不能可靠地区分模型。

为量化接口层表现,提出两项度量:

实验中观察到两条一致模式:

  1. 监控不足:尽管手册要求每 20 回合 查询一次胜利进度,代理实际查询间隔为 30‑75 回合;在 20 回合 警告窗口内未查询导致 7/20 可检测的失败。
  2. 承诺执行率低:代理经常未兑现近期规划承诺,RAG@1048.2%‑65.8% 之间波动。

这些现象即使在提供工具访问和明确指导的情况下仍然出现,我们将其解释为 指令偏差 而非能力缺失。

环境、场景、日志、度量以及分析流水线已在 GitHub 开源:https://github.com/lmwilki/civ6-mcp

点评

原文链接: https://arxiv.org/abs/2609.02459

[h] 返回首页