NeFut Logo NeFut
EN 管理员登录

[AI学术] 关于排斥与吸引教师:在自蒸馏中将正确性与行为分离

发布于:2026-09-22 22:00 最后更新:2026-09-24 00:40
#Machine Learning #LLM #Artificial Intelligence

在自蒸馏中,模型通过在特权信息条件下生成教师分布,再将该分布蒸馏回自身,从而获得密集的 token 级监督。特权信息不仅改变教师的知识,还会改变其行为,使得学习信号混杂了正确性和行为偏移。我们在推理任务中分别考察了两种自蒸馏方式:吸引式自蒸馏把模型拉向特权教师,排斥式自蒸馏把模型推离特权教师。实验表明,两者都会产生显著且相反的行为变化。吸引式抑制了模型的探索性推理,生成更短且更自信的答案;排斥式则延长回答长度,容易触发模型潜在的思考模式,且在训练后期出现不稳定。基于此,我们提出对比自蒸馏:同时吸引模型向由正确解条件化的教师靠拢,并排斥由错误解条件化的教师。不同于以往将此类蒸馏信号与 GRPO 目标混合的做法,我们单独研究了对比蒸馏目标本身的行为。结果显示,两位教师的行为偏移大致相互抵消,留下的 token 级信号更直接地反映答案的正确性。无论是未进行思考的模型、仅指令微调的模型,还是已经具备思考能力的模型,对比蒸馏都提升了推理性能,同时保持了响应长度的稳定。

点评

原文链接: https://arxiv.org/abs/2609.21561

[h] 返回首页