NeFut Logo NeFut
EN 管理员登录

[AI学术] 编译代理:通用编码代理从零交互构建获胜游戏玩家

发布于:2026-09-18 22:00 最后更新:2026-09-20 12:54
#AI #Machine Learning #LLM

LLM 代理一直难以把对游戏的知识转化为熟练的操作,即使研究者为模型提供感知、记忆、技能库、规划器或可执行策略的支撑。近期编码代理的快速进展提出了两个更尖锐的问题:前沿模型是否已经能够在任何游戏中获胜?它们能否在完全不依赖外部帮助的情况下自行构建完整的玩家?

我们提出 Gauntlet 框架,它遵循“开发‑冻结‑评估”流程,将从小型街机到商业级大作的游戏迁移到同一套实验环境。框架的核心约束极其简约:通用编码代理仅收到游戏描述、原始的观察/动作接口以及一个空的策略文件——不提供任何策略、算法或架构信息。

在一次完全自主的会话中,代理在实时游戏中进行实验,生成一个独立的控制器代码;随后我们冻结该代码,在未见过的实例上进行评估,评估期间不再调用模型。实验结果显示,在一个未公开的程序化 Roguelike 中,冻结后的成功率在 0%‑86% 之间波动,并出现了明显的代际阈值:最新一代系统的每一次观测会话都优于前一代系统的最佳会话。

在完整游戏尺度上,编译得到的原始 API 控制器击败了所有公平的 StarCraft II 内置 AI 以及两种作弊变体;单次会话生成的程序在未见种子下完成了《文明》(Freeciv)的全局征服。虽然相对于新手 AI 的胜率仍然有限,但这是首次出现语言代理系统在无需每回合模型调用、也不依赖手工战术层的情况下,独立赢得此类完整游戏的案例。

这些结果表明,前沿编码代理已经开始捕捉长期策略,并且冻结后的程序可供检查。我们将这种能力称为 编译代理:模型构建的开发经验被编译成持久的可执行体,其内部架构完全由模型生成。

点评

原文链接: https://arxiv.org/abs/2609.18996

[h] 返回首页