大型语言模型(LLM)代理在解决复杂工具使用任务时,越来越依赖自然语言技能。然而,这类任务往往存在多条可行的解题路径,单纯让失败轨迹模仿固定的成功轨迹并不合理。更重要的是,失败的轨迹并非全盘错误:代理可能在前段收集到有价值的证据并取得实质性进展,但随后在后缀出现偏差。
基于此,我们提出 SkillPivot——一种以偏差点为导向的技能自我进化框架。SkillPivot 通过三类信号检测从有用前缀到错误后缀的转折点:执行有效性、目标进度以及动作多样性。检测到转折后,系统会召唤一个更强的教师模型,从相同的前缀继续执行,生成在相同交互历史下的成功后缀。随后,将学生的错误后缀与教师的成功后缀进行对比,局部化地更新技能参数,既保留已有的有效指导,又纠正错误部分。
在 ToolQA、LogicBench 与 WildClawBench 三个基准上进行实验,SkillPivot 始终优于其他技能进化方法,提升了多种代理模型的表现,并且生成的技能更新紧凑且易于迁移。
点评