NeFut Logo NeFut
EN 管理员登录

[AI学术] 在关键位置使用教师令牌:成功参考的在线策略蒸馏

发布于:2026-10-05 22:00 最后更新:2026-10-06 12:11
#Machine Learning #LLM #Artificial Intelligence

在线策略蒸馏(OPD)通过让学生自行生成回合并结合教师提供的密集 token 级监督来提升模型能力,但为每一次回合都提供监督会导致教师计算开销巨大。我们提出 成功参考的在线策略蒸馏(SR‑OPD),通过挑选需要教师监督的提示和回合来显著降低成本。

当学生在同一提示下既产生成功回合又产生失败回合时,成功回合可以作为自然参考,用来判断哪些失败回合值得获得教师监督。SR‑OPD 重点关注这类提示,并优先选择隐藏状态轨迹与成功参考持续分歧的失败回合,同时估算教师输入代价以控制预算。

在三个教师‑学生配对和六个数学推理基准上进行实验,SR‑OPD 在单遍设置下仅使用 Vanilla OPD 需要的 3.46%‑5.02% 教师输入 token,却保持了相近的推理性能。进一步在与 Vanilla OPD 教师输入预算 5% 匹配的受控实验中,结果验证了两个关键设计:① 将监督聚焦在同时出现成功与失败回合的提示上;② 使用成功回合引导失败回合的筛选。

这些发现表明,学生自身的成功行为可以作为有效参考,在固定的教师输入预算下合理分配教师监督资源。

点评

原文链接: https://arxiv.org/abs/2610.02678

[h] 返回首页