摘要
本文探讨了ARC-AGI-3代理模型的性能归因问题。我们设计了四种基于Codex的代理:
- 文本基线
- 灵活接口的可执行世界模型(无重放验证)
- 具有计划简化的可执行模型
- 固定接口的验证处理(保留简化并要求精确重现记录的观察)
主要研究评估了这四种代理在高和超高推理努力下对公共ARC-AGI-3游戏的表现。探索性后续研究则评估了文本和验证变体在超高和最大推理努力下的表现。
研究结果显示,所有代理变体在更强的模型和更高的推理努力下均有所提升。每种模型-努力设置下,各变体间的差异小于预期,而各个组件的效果在不同设置中有所不同。要求持续的可执行交付物并非普遍有利:文本变体在gpt-5.5设置中优于灵活接口的可执行变体。简化在四种模型-努力设置中的三种情况下提高了性能,唯一的例外是最弱设置。
完整的验证处理在四种设置中均排名第一,尽管其使用了显著更多的资源。在gpt-5.6-sol的后续研究中,验证变体在两个推理努力下完全解决了每个公共游戏,达到约99%的RHAE,并且使用的总动作数不到人类基线的一半。由于模型在这些游戏发布后产生,且保留性能尚未测试,因此该结果应视为公共集的饱和。
博主点评: 本文通过对不同代理模型的细致对比,揭示了可执行世界模型和验证机制在解决复杂任务时的相对重要性,提供了对于未来AGI研究的深刻启示。尤其是对于模型性能的影响,值得进一步探讨和实验。