自主软件生成(ASG)旨在把人类需求直接转化为可执行的应用,但仅交付应用并不能保证其交互组件满足行为需求。为此我们提出 GameASG-Bench,将行为可测性纳入游戏开发的生成任务。
在生成前,评估接口规范会被声明,包括合法的起始场景、玩家层级操作、稳定快照、拒绝行为以及不变式,而私有实现细节保持开放。具体实现包括两类检查:
- L1 静态检查,评估源码层面的合规性;
- L2 浏览器执行检查,结合语义观察、真实输入和运行时证据。
我们将该协议实现为 47 项基于浏览器的原生游戏生成任务,覆盖 12 种主要类型以及 2D 与 3D 交互,每项任务配有可执行检查和独立验证的参考实现。
实验围绕四个关键问题展开:端到端代理性能、工具访问与名义回合预算、推理投入以及测试框架选择。九个代理堆栈的实验结果显示,最高的 L2 检查平均通过率为 93.2%,但严格任务成功率(即所有 L1 与适用 L2 前置及核心要求均通过)最高仅为 55.3%(26/47 任务)。对于 DeepSeek‑V4‑Flash,完整的工具访问和更大的回合预算提升了严格任务成功数,但成功率并非随推理投入单调增长。两种测试框架各自实现了 18 项严格任务成功,只有 10 项在两者间同时成功。
这些结果揭示了任务层面的合规缺口:高平均检查通过率往往掩盖了实际的严格成功率不足。
点评