监督微调教师生成的轨迹是蒸馏工具调用能力的标准第一阶段。部署后的工具调用代理会在每日或每周重新运行该阶段,承担教师模型的高昂成本,但采用的是“生成‑过滤”机制——仅保留通过的轨迹,丢弃其余。由于失败的案例没有提供学习信号,循环中同样的困难场景会反复出现。
在 $\\tau$2-bench 上,教师模型有 57% 的试验失败,其中约三分之二是“差一点”成功——大多数工具调用正确,仅因一次关键错误而失效。
我们提出 PROOF-Gen(Per‑scenario Reflective Optimization to Overcome Failed Generation),通过对每个失败任务进行场景级提示优化来恢复黄金轨迹。具体做法是:反思器分析执行轨迹和评估反馈,生成纠正性指导,引导教师重新生成通过的轨迹。训练前会去除这些指导,使学生模型仅学习干净的示例。
在 $\\tau$2-bench 上,场景级优化恢复了 93% 的失败场景。将恢复后的数据与原始数据合并微调后,Qwen3‑4B‑Instruct‑2507 的 Pass$^1$ 从 0.132 提升至 0.529,Gemma 4 E4B‑it 在 BFCL v4 多轮任务上提升了 7.2 个百分点。
在实际部署流水线中,该方法将轨迹质量提升了 6.3 个百分点的目标完成率,并在设备端模型上实现了 +1.5 个百分点的目标完成率提升,响应质量指标提升 1.7‑5.0 个百分点,所有语言环境均呈正向迁移,非英语平均提升 1.48 个百分点。
博主点评:PROOF‑Gen 通过让模型自我反思并纠正错误,显著提升了蒸馏数据的质量,尤其在高失败率的工具调用任务中表现突出。该思路兼顾了数据效率和部署成本,值得在更多跨语言和多模态场景中探索。