在大语言模型推理中,在线蒸馏(OPD)通过让学生模型在自己的生成路径上接受教师的逐标记监督来提升性能。传统的逐标记 OPD 只能提供局部的监督,缺乏对学生当前推理步骤的整体修正建议。当学生产生了退化的前缀时,教师的监督仍然以该前缀为条件,可能会强化错误的推理模式。
为了解决上述问题,本文提出了段级在线蒸馏(Seg‑OPD),通过对中间推理片段进行干预来学习推理修正。具体做法是:① 使用不确定性度量挑选学生生成的推理片段;② 让教师对同一上下文重新撰写该片段形成 redraft;③ 在训练时同时保留逐标记的 OPD 损失,并加入一个段级对比损失,使学生倾向于选择教师的 redraft 而非原始片段。
实验覆盖数学推理和竞争编程两类任务。结果显示,Seg‑OPD 在修正成功率上显著高于基线,并在推理准确率上实现约 5.22% 的相对提升,且在多种模型和数据集上保持稳定优势。代码已开源。
点评