CraftBenchUE 是一个在独立的 Unreal Engine 环境中运行编码代理的评估框架。它会把代理的提交重新构建到全新项目中,并在不依赖 LLM 判官的情况下执行确定性的编译、资源和运行时检查。基于该框架,我们构建了包含 70 项任务的基准,任务覆盖 C++ 源码、Blueprint 资产和编辑器脚本。我们在两种编辑器工具配置下评估了七个模型,并在 C++ 任务上加入了 file‑and‑shell 基线。为了比较语言差异,我们将实现相同游戏玩法、使用相同运行时测试但交付形式分别为 C++ 与 Blueprint 的任务配对。结果显示,在 10 对配对任务中,C++ 的完成率分别比 Blueprint 高出 30.0% 和 42.9%。在按时提交且通过资产检查的 Blueprint 结果中,分别有 42.2% 和 50.0% 未通过显式的运行时断言,这说明它们满足资源要求但未实现预期的游戏行为。我们将在报告中公开评估框架、任务基准以及实验轨迹。
点评