NeFut Logo NeFut
EN 管理员登录

[AI学术] 面向小型语言模型代理的 Harness 感知蒸馏

发布于:2026-10-05 22:00 最后更新:2026-10-06 12:11
#AI #Machine Learning #LLM

语言模型代理通常配备一个 harness——负责管理上下文、工具和反馈的外部软件。当把一个大模型代理蒸馏成更小的学生模型时,harness 仍然保持不变,学生模型只需要学习教师模型在 harness 之外的能力,例如正确利用 harness 提供的信息。传统蒸馏直接模仿教师的全部输出,并把 harness 视作普通输入,导致学生难以捕捉到教师的增益部分。为此我们提出 Harness‑Aware Distillation(HAD),它只关注教师相对于 harness 的额外贡献。HAD 在 on‑policy 蒸馏的基础上加入两个模块:

该对比提供了学生单纯模仿教师无法获得的信息,且 HAD 不依赖任务奖励、成功标签或未来信息。我们在多个长时序代理基准和不同模型上实验,结果显示在相同固定 harness 下,HAD 超越了所有 on‑policy 蒸馏基线。进一步分析表明,HAD 更少陷入无效循环,错误恢复次数也高于基线,说明它在权重中保留了可学习的反馈,同时仍从 harness 中读取状态信息。

点评

原文链接: https://arxiv.org/abs/2610.02858

[h] 返回首页