NeFut Logo NeFut
EN 管理员登录

[AI学术] Schema:通过代理程序归纳发现未知环境

发布于:2026-10-02 22:00 最后更新:2026-10-06 12:11
#AI #Machine Learning #LLM

学习在规则未知的全新环境中完成任务是大型语言模型(LLM)代理面临的核心难题。现有代理往往以散文形式记录发现,这种方式缺乏紧凑、可检验的环境描述。受科学家将观察组织为可测试、可预测理论的启发,我们提出 Schema——一种通过交互式程序归纳组织学习与行动的代理框架。

在 Schema 中,LLM 代理自行决定探索目标和行动方式,并将对环境的逐步理解以可执行程序的形式表达。框架核心包括:

这种“程序化”思路让代理能够在每一步验证中确认假设,从而快速收敛到正确的环境机制。实验结果显示,使用相同基础模型时,Schema 将 ARC‑AGI‑3 RHAE 指标从 58.7% 提升至 99.2%,在公开的 DiG‑bench 中实现 100% 游戏通关,并在 MazeBench 上达到前 50 名人类玩家的中位表现。进一步的分析表明,Schema 在未知机制发现方面具备显著优势,消融实验也验证了每个组件的贡献。

点评

原文链接: https://arxiv.org/abs/2609.39140

[h] 返回首页