NeFut Logo NeFut
EN 管理员登录

[AI学术] GameLogicBench:基于 Tick 级状态断言的运行时游戏逻辑评估

发布于:2026-09-22 22:00 最后更新:2026-09-24 00:40
#algorithm #AI #Machine Learning

Coding agents 能在大型软件项目中修改并测试代码,游戏开发是其必须实现玩法规则的典型场景。游戏即使在运行时违背规则,也可能在结束时达到合法状态。现有的游戏开发基准要么回放固定示例,要么评分视频,或让另一模型判断结果,均未在执行过程的每个 tick 对规则进行检查,也无法保证评判结果可完全复现。为此我们推出 GameLogicBench,收录 72 项基于 Godot 引擎的玩法逻辑任务。自动评估器在每个仿真 tick 检查游戏规则,覆盖 403 个人工设计场景,参数变体产生 1 451 条测试用例。评估器必须接受所有正确实现,同时拒绝缺失必需能力的变体,以确保衡量的是行为而非实现细节。任务包括单一机制、多系统交互以及仓库规模特性。我们在 20 种语言模型与脚手架组合上进行实验,最佳模型在任务上的通过率为 52.78%。在 Claude Code 环境下,所有 12 种模型的通过率随任务范围从单一机制到系统交互再到仓库规模逐步下降。面对仓库规模任务,Agent 检查代码的频率和工具调用次数均显著高于单一机制任务。大多数未通过的提交能够运行,但在某些必需的游戏行为上实现错误。我们比较了带有变体验证和不带验证的评估器版本,发现缺少验证会导致错误提交被误判通过。另有分析显示,当网络访问开放时,Agent 会直接复制公共仓库代码,进一步影响评估可靠性。可靠的评估既依赖于测试的拒绝能力,也取决于 Agent 能获取的外部代码资源。

点评

原文链接: https://arxiv.org/abs/2609.21562

[h] 返回首页