摘要
知识蒸馏(KD)是压缩序列到序列模型的标准方法,但其对每个样本的影响鲜有研究。在BanSum Bangla摘要基准上,我们发现标准KD仅比交叉熵基线提高了+0.0003,而约51.3%的训练样本在标准KD下被估计会对学生验证损失产生负面影响。
我们提出了两种互补的可靠性意识蒸馏方法。CHAD(反事实危害意识蒸馏)通过与验证损失方向的梯度对齐来衡量每个样本的KD有效性,并训练一个轻量级的门控机制,将这种反事实判断推广到整个训练集。EWAD+CPDP结合了基于标记的熵加权自适应蒸馏和来自第二个不兼容词汇教师的容量比例几何约束。
在BanSum上,这两种方法均显著超越了标准KD:CHAD提高了+0.0173 ROUGE-L,EWAD+CPDP提高了+0.0219 ROUGE-L,而标准KD本身仅提高了+0.0003;尽管使用的参数仅为6000万个,但两者都超越了微调的Qwen 2.5-3B模型(大50倍)。
我们进一步评估了更强的方法EWAD+CPDP,在15种类型多样的XL-Sum语言中组织成三组,击败了10/15种语言的CE-only基线;增益在两位教师贡献互补信号时最为可靠,而在目标语言覆盖饱和或共同弱的情况下则最为薄弱。我们发布了代码和训练模型,以支持可重复性和进一步的选择性蒸馏研究。
博主点评: 本文提出的CHAD和EWAD+CPDP方法通过考虑每个样本的可靠性,显著提高了低资源语言摘要的效果,挑战了传统知识蒸馏的局限性。研究结果强调了在模型训练中评估每个样本的重要性,具有重要的实践意义。