NeFut Logo NeFut
EN 管理员登录

[AI学术] ToolAnchor:打破行为惯性,提升工具使用能力的革命性框架

发布于:2026-07-17 22:00 最后更新:2026-07-18 08:18
#AI #Machine Learning #Reinforcement Learning

摘要

工具增强的大型语言模型代理在长时间任务中表现优异,但通常是在固定工具集上进行后期训练。当任务需要新工具时,这些代理在有效整合新工具方面往往面临困难,而从头开始重新训练又往往不切实际。我们将这种工具集扩展问题的核心障碍确定为行为惯性:即代理在面对新工具时,倾向于依赖熟悉的工具和既定的推理模式。

我们展示了在关键决策点注入反事实锚定上下文可以打破这种惯性,通过激发被抑制的代理能力来恢复失败的轨迹。为此,我们提出了ToolAnchor框架,该框架利用教师模型假设这些反事实上下文,通过学生回放验证这些上下文,并通过代理后期训练将成功的干预内化。

在通用AI助手(GAIA)、文本搜索(BrowseComp)和视觉搜索(VDR-Bench)任务上的广泛评估表明,ToolAnchor在扩展工具集下始终展现出竞争力表现。我们的工作弥合了静态后期训练与动态适应之间的差距,为可扩展的代理强化学习开辟了一条新路径。

博主点评: ToolAnchor框架通过引入反事实上下文,有效地解决了传统工具集扩展中的行为惯性问题。这种方法不仅提升了代理的灵活性,还为未来的智能代理发展指明了方向,具有重要的理论和实践价值。

原文链接: https://arxiv.org/abs/2607.14145

[h] 返回首页