NeFut Logo NeFut
EN 管理员登录

[AI学术] 知而不言:通过回忆锚定蒸馏防止LLM SFT中的事实访问失效

发布于:2026-08-24 22:00 最后更新:2026-08-29 12:04
#Machine Learning #optimization #LLM

在监督微调(SFT)过程中,模型在目标领域的表现提升往往伴随对分布外(OOD)事实的访问能力下降。作者将这种现象称为“事实访问失效”,即模型在受限评估下仍能识别或排序正确答案,却在闭书生成时无法输出。

通过基准比较、同事实多选与生成探针以及失效模式分析,发现退化既包括真实的错误答案,也包括表达层面的失误,如冗长、格式不匹配以及对精确匹配的过度依赖。

为此提出“回忆锚定蒸馏”(Recall-Anchored Distillation,RAD),一种基于原始基模型软续写分布的自蒸馏目标。RAD 在未标注的 OOD 文本上让适配模型的输出分布对齐基模型,无需金标准答案、外部评审或标注事实数据。

实验在三个以 MedMCQA 为微调任务的主干模型上进行,RAD 能在保持目标领域适应性的同时,恢复相当比例的 OOD 召回率。与单纯重放相同 OOD 文本的对比表明,关键的保持信号来自基模型的软分布,而非额外的文本曝光。

博主点评:RAD 的设计巧妙地利用了基模型的隐式知识,在不增加标注成本的前提下显著缓解了事实访问失效,为实际部署提供了实用路径。

原文链接: https://arxiv.org/abs/2608.20794

[h] 返回首页