NeFut Logo NeFut
EN 管理员登录

[AI学术] AgentBrew:从强教师到弱LLM代理的终身知识酿造

发布于:2026-07-21 22:00 最后更新:2026-07-22 01:01
#algorithm #AI #Machine Learning

在部署大型语言模型(LLM)代理时,通常需要一个紧凑的测试时间学生,即使在训练期间有更强的教师可用。我们研究了知识酿造:将教师的交互经验提炼成学生的持久外部记忆。关键在于,这一过程不需要权重更新、专家示范、真实标签或测试时间教师访问。

这一设置面临两个挑战:环境仅提供稀疏的二元反馈,而教师撰写的笔记必须在本质上能够被显著较弱的学生具体执行。为了解决这些难题,我们提出了AgentBrew,包括两个相互关联的组件。

首先,失败触发的教师——Ralph Loop通过将学生的失败转化为经过环境验证的笔记来减轻稀疏反馈的问题。其次,学生感知合成将教师知识校准到弱执行者的操作粒度,从而产生特定模型的可操作指导。

广泛的评估和全面的消融实验显示,这种不对称的、无训练的酿造范式能够产生高度能力且可部署的LLM代理。

博主点评:AgentBrew提出了一种创新的方法,通过教师与学生之间的知识转移解决了LLM代理在实际应用中的限制。其失败触发机制和针对性指导的设计,展示了如何在缺乏直接反馈的情况下提升模型的执行能力,值得关注。

原文链接: https://arxiv.org/abs/2607.16851

[h] 返回首页