NeFut Logo NeFut
EN 管理员登录

[AI学术] Kepler:可审计的世界模型用于 ARC-AGI-3

发布于:2026-10-02 22:00 最后更新:2026-10-06 12:11
#AI #Open Source #GPT

ARC‑AGI‑3 要求智能体在交互环境中通过观察推断规则和目标。我们推出 Kepler,一个开源框架,将假设表示为可执行的世界模型,并通过事后转移检查和条件预测检查进行验证。

在一次冻结的 Claude Opus 5 配置下,Kepler 在全部 25 个公开游戏上获得了服务器验证的 100.00 RHAE,未进行每局模型选择或基于分数的重跑。

在 183 个已完成关卡中,有 181 关的最终 Opus 尝试使用的动作数不超过对应的中位数人类基线。保留的棋盘运行共计 8,256 次环境动作,其中 7,292 次发生在计分关卡。

本地提供者会话记录累计 858.0 百万 token,缓存读取率 97.37%,按 2026‑09‑01 API 费率折算成本约为 $777.72。

我们还记录了三类评估失效:源码泄漏导致的无效完美运行、智能体在对照条件下重建被移除的框架、以及自主修复掩盖了破损的规划器。

单局观察案例显示,动画帧中包含了文本网格未呈现的任务相关信息。

在最终的 Claude Opus 5 与 GPT‑5.6 Sol 棋盘上,50 个游戏‑模型单元中有 48 达到 100。

这些结果表明,仅凭公开集分数的区分能力有限,呼吁首次尝试、成本约束和可验证报告的实践。

点评

原文链接: https://arxiv.org/abs/2610.00834

[h] 返回首页