LLM 代理的性能在很大程度上取决于围绕冻结模型的脚手架。常见的提升方式是使用编码代理作为优化器:它读取当前的分数和执行轨迹,迭代编辑源码,在每轮生成新的候选。每一次编辑都是依据对环境响应的信念——即哪里出错、哪种改动可能有帮助——来选择的。该信念通常是隐式的,存在于编码代理的即时推理或参数中,而不是以书面形式记录下来。于是后续调用只能看到分数和轨迹,却无法直接利用先前的信念。
我们提出 Belief‑Calibrated Optimization (BCO),它将信念显式写入一个持久的上下文文档,并在每次评估新候选后持续修订该文档。该文档充当世界模型,记录环境对编辑的当前响应方式。将 BCO 加入标准的优化循环后,在五个基准上(包括记忆问答、工具使用问答、代码即动作的应用代理以及终端代理)实现了比仅缺少世界模型的对照组更高的训练通过率。该优势在所有未见的拆分上仍然保持,这些拆分在候选选择阶段并未被使用。
在一次目标模型替换实验中,冻结模型被新模型取代,而脚手架保持不变,BCO 生成的脚手架在我们测试的任务上仍然领先,唯一的例外是上下文窗口溢出导致的未完成情况。
随后进行的离线消融实验检验了性能提升是否来源于世界模型的内容。一个全新的预测器在给定累计文档后,对环境响应的预测准确度显著高于仅使用无文档或内容被篡改的同形文档的预测器。该比较表明,文档的内容本身携带了可复用的信息,而不仅仅是其形式。
点评