语言模型代理通常配备一个 harness——负责管理上下文、工具和反馈的外部软件。当把一个大模型代理蒸馏成更小的学生模型时,harness 仍然保持不变,学生模型只需要学习教师模型在 harness 之外的能力,例如正确利用 harness 提供的信息。传统蒸馏直接模仿教师的全部输出,并把 harness 视作普通输入,导致学生难以捕捉到教师的增益部分。为此我们提出 Harness‑Aware Distillation(HAD),它只关注教师相对于 harness 的额外贡献。HAD 在 on‑policy 蒸馏的基础上加入两个模块:
- 动作偏好:对同一教师在有无 harness 信息下的动作进行对比,在学生自行推理之后给出得分;
- 有效性检查:剔除那些偏好动作与 harness 记录冲突的对比对。
该对比提供了学生单纯模仿教师无法获得的信息,且 HAD 不依赖任务奖励、成功标签或未来信息。我们在多个长时序代理基准和不同模型上实验,结果显示在相同固定 harness 下,HAD 超越了所有 on‑policy 蒸馏基线。进一步分析表明,HAD 更少陷入无效循环,错误恢复次数也高于基线,说明它在权重中保留了可学习的反馈,同时仍从 harness 中读取状态信息。
点评