学习在规则未知的全新环境中完成任务是大型语言模型(LLM)代理面临的核心难题。现有代理往往以散文形式记录发现,这种方式缺乏紧凑、可检验的环境描述。受科学家将观察组织为可测试、可预测理论的启发,我们提出 Schema——一种通过交互式程序归纳组织学习与行动的代理框架。
在 Schema 中,LLM 代理自行决定探索目标和行动方式,并将对环境的逐步理解以可执行程序的形式表达。框架核心包括:
- 持久化的程序工作区,用于保存和迭代环境模型;
- 一组轻量接口,能够将程序与交互历史对照检查、在程序内部进行规划、以及在逐步验证下执行计划。
这种“程序化”思路让代理能够在每一步验证中确认假设,从而快速收敛到正确的环境机制。实验结果显示,使用相同基础模型时,Schema 将 ARC‑AGI‑3 RHAE 指标从 58.7% 提升至 99.2%,在公开的 DiG‑bench 中实现 100% 游戏通关,并在 MazeBench 上达到前 50 名人类玩家的中位表现。进一步的分析表明,Schema 在未知机制发现方面具备显著优势,消融实验也验证了每个组件的贡献。
点评