NeFut Logo NeFut
EN 管理员登录

[AI学术] 校准教师‑学生差异的在策略蒸馏方法

发布于:2026-09-21 22:00 最后更新:2026-09-22 02:29
#Machine Learning #optimization #Artificial Intelligence

在本文中,作者关注 on‑policy distillation(OPD)在推理模型中的应用。传统 OPD 通过学习更强教师模型与在策略学生模型之间的 token 级别差异来提升学生性能。然而,这一差异不仅包含教师与学生能力的真实差距,还混入了教师自身的偏差(self‑deviation),导致学生在训练时被动学习教师的错误。特权 OPD(privileged OPD)会进一步放大教师侧的似然偏移,使问题更严重。为了解决此问题,作者提出 Calibrated On‑Policy Distillation(Cal‑OPD)。该方法利用正负特权干预来估计教师的自偏差区域,并仅保留超出该区域的教师‑学生差异作为优化信号,从而校准原始差异。实验在多个数学推理基准上进行,结果显示 Cal‑OPD 只保留约 52%‑65% 的原始差异,却在不同模型规模下始终优于标准 OPD 及其变体。

点评

原文链接: https://arxiv.org/abs/2609.21619

[h] 返回首页