在策略蒸馏(On‑policy Distillation,OPD)已成为语言模型后训练的关键手段。虽然 OPD 能提升下游性能,但也会出现生成过长、重复的崩溃现象,背后的机制尚不清晰。本文从强化学习的角度解释这一现象:教师模型在隐式地为学生行为打分,即使这些行为教师本身很少产生。实验表明,OPD 在不扩大学生能力范围的前提下提升了正确答案的采样概率。当隐式奖励模型可靠时,学生更容易生成高质量响应;但若奖励偏好与真实质量不一致,就会出现奖励黑客(reward hacking),导致学生产生冗长、重复的文本,尽管教师几乎不生成此类文本。基于此诊断,本文提出两种简单的缓解措施:在训练时屏蔽不健康的响应,以及使用监督微调(SFT)初始化模型。实验验证这两者均能显著降低崩溃概率。总体而言,OPD 放大了教师隐式反馈偏好的学生行为,核心问题从“教师生成得好”转向“教师对学生回滚的评估可靠性”。代码已开源:https://github.com/HancCui/opd_hacking
点评