在本文中,作者关注 on‑policy distillation(OPD)在推理模型中的应用。传统 OPD 通过学习更强教师模型与在策略学生模型之间的 token 级别差异来提升学生性能。然而,这一差异不仅包含教师与学生能力的真实差距,还混入了教师自身的偏差(self‑deviation),导致学生在训练时被动学习教师的错误。特权 OPD(privileged OPD)会进一步放大教师侧的似然偏移,使问题更严重。为了解决此问题,作者提出 Calibrated On‑Policy Distillation(Cal‑OPD)。该方法利用正负特权干预来估计教师的自偏差区域,并仅保留超出该区域的教师‑学生差异作为优化信号,从而校准原始差异。实验在多个数学推理基准上进行,结果显示 Cal‑OPD 只保留约 52%‑65% 的原始差异,却在不同模型规模下始终优于标准 OPD 及其变体。
点评