NeFut Logo NeFut
EN 管理员登录

[AI学术] GameASG-Bench:面向游戏开发的自主软件生成基准

发布于:2026-09-21 22:00 最后更新:2026-09-22 02:29
#AI #Machine Learning #DeepSeek

自主软件生成(ASG)旨在把人类需求直接转化为可执行的应用,但仅交付应用并不能保证其交互组件满足行为需求。为此我们提出 GameASG-Bench,将行为可测性纳入游戏开发的生成任务。

在生成前,评估接口规范会被声明,包括合法的起始场景、玩家层级操作、稳定快照、拒绝行为以及不变式,而私有实现细节保持开放。具体实现包括两类检查:

我们将该协议实现为 47 项基于浏览器的原生游戏生成任务,覆盖 12 种主要类型以及 2D 与 3D 交互,每项任务配有可执行检查和独立验证的参考实现。

实验围绕四个关键问题展开:端到端代理性能、工具访问与名义回合预算、推理投入以及测试框架选择。九个代理堆栈的实验结果显示,最高的 L2 检查平均通过率为 93.2%,但严格任务成功率(即所有 L1 与适用 L2 前置及核心要求均通过)最高仅为 55.3%(26/47 任务)。对于 DeepSeek‑V4‑Flash,完整的工具访问和更大的回合预算提升了严格任务成功数,但成功率并非随推理投入单调增长。两种测试框架各自实现了 18 项严格任务成功,只有 10 项在两者间同时成功。

这些结果揭示了任务层面的合规缺口:高平均检查通过率往往掩盖了实际的严格成功率不足。

点评

原文链接: https://arxiv.org/abs/2609.21293

[h] 返回首页