世界模型是一个复杂的领域:架构、训练目标和状态表示以复杂的方式相互作用,没有单一的配方可以在所有环境中占据主导地位。这使得它成为一个理想的测试平台,用于具有自主研究能力的AI编码代理,在这种设置中,改进方向不会提前指定,不像当前代理基准中占主导地位的工程到规范任务。我们介绍了AutoWorldModel-Bench,这是一个闭环基准,先进的编码代理在固定计算预算下自主改进提供的世界模型初始值。基准涵盖了八个游戏环境,采用统一的结构化状态表示,即从每个游戏中提取的实体状态真值,并通过共享的张量格式进行消费,这种方法可以将动态建模与感知分离,并实现每次运行仅需几分钟。跨越64个会话,Codex-5.4和Claude Opus 4.6在63个会话中改进了初始模型;在91%的会话中,获胜的编辑是一种非平凡的研究风格修改——新的目标、表示、滚动程序或架构更改,而不是超参数调整。我们的基准提供了一个设置,先进的编码代理可以在开放式研究而不是工程到规范问题上进行评估。 博主点评: 本文提出了一种新的基准,用于评估AI编码代理在自动世界模型研究方面的能力,这是一个非常有趣的研究领域,代理需要自主地改进世界模型,这需要代理具有很强的研究能力和创造力,这项工作为AI编码代理的发展提供了一个新的方向和挑战。