NeFut Logo NeFut
EN 管理员登录

[AI学术] 颠覆认知:高效混合序列模型的生成聚焦蒸馏研究

发布于:2026-07-21 22:00 最后更新:2026-07-22 01:01
#AI #Machine Learning #optimization

摘要

通过蒸馏将预训练的Transformer转化为更高效的混合模型,能够有效降低推理成本。然而,要在蒸馏模型中实现高质量的生成,需要仔细设计学生架构与蒸馏过程。许多先前的蒸馏工作通过对候选答案进行对数似然的排名,而非要求自回归生成,来评估下游多选基准,这可能掩盖模型质量的重要差异。

例如,在重叠基准上,我们展示了一个7B的蒸馏模型在对数似然评分下几乎与其教师模型相匹配(仅相差0.2 pp),但在必须进行自回归生成时却落后20.8 pp。我们通过GenDistill进行研究,这是一个我们设计的多阶段管道,用于将预训练的Transformer蒸馏为高效的混合Kimi Delta注意力(Hybrid-KDA)学生模型。我们在Qwen3-0.6B上将其作为受控测试平台,系统性地对六个设计轴(训练目标、损失掩蔽、训练持续时间、数据集选择、参数冻结和架构选择)进行消融实验,并在对数似然和生成基础协议下评估每个选择。

我们发现基于对数似然的评估始终低估了教师与学生之间的差距,并且在某些情况下可以反转设计选择的排名,因此仅基于困惑度的评估得出的结论可能具有误导性。在我们研究的因素中,数据集选择、仅完成掩蔽和在后训练期间冻结注意力层对生成质量的影响最大。我们最佳的蒸馏方案,使用Hybrid-KDA模型作为学生,能在知识基准上保留86-90%的教师准确率,同时将KV缓存内存减少高达75%,并在128K-token上下文中将首次生成时间提升2-4倍。

博主点评: 本文揭示了蒸馏模型生成质量的关键因素,强调了对数似然与生成评估的差异。研究结果为未来高效模型的设计提供了重要指导,尤其是在选择数据集和训练策略时,显示出其对最终性能的显著影响。通过优化蒸馏过程,研究者们能够在保持模型精度的同时显著提高推理效率。

原文链接: https://arxiv.org/abs/2603.26556

[h] 返回首页