摘要
结构化剪枝是一种硬件友好的LLM压缩方法,但主要在多选识别任务上得到验证,而在实际需要的自由形式生成中,相同的压缩检查点可能会崩溃。本文提出了两个观察结果来解释这一差距。首先,贪婪的 \textsc{pass}@$1$ 在压缩后几乎消失,而 \textsc{pass}@$k$ 在重复采样中得到了显著恢复:有用的生成结果被降级而不是消除。其次,可恢复的状态主要由于后缀重复而失败。因此,恢复过程应在压缩模型的自身在线状态上进行训练,并通过密集的令牌级监督来实现,这正是在线政策蒸馏(On-Policy Distillation, OPD)所提供的,通过重用预压缩模型作为固定教师。
然而,长期的在线回放在早期恢复预算上花费在低信息的重复后缀上,延迟了损失的下降。为了解决这一浪费,我们提出了 extbf{ShortOPD},一种短期到长期的OPD调度,能够检测教师确认的重复后缀,并将存活的前缀视为每次回放的有效长度,从而将未来的回放预算分配给当前策略能够使用的有效长度。
在数学、代码和开放式生成任务中, extbf{ShortOPD} 将压缩模型的分数提升至约 $9 imes$ 其未恢复值,以及 $1.6$--$4.4 imes$ 标准恢复方法(不使用KD的SFT,KD和SeqKD),并在训练时间上仅用四分之一的时间($8.5$ 小时对比 $35.9$ 小时)和 $71\%$ 更少的回放令牌,达到了固定 $8192$ 令牌回放范围内的两分差距。我们希望这一方法能将结构化剪枝推向超越困惑度和多项选择基准的边际收益,朝着部署就绪的生成质量更进一步。
博主点评: 本文提出的ShortOPD方法在压缩模型的恢复性能上取得了显著提升,尤其是在处理长序列时,通过优化有效长度和回放预算,展现了在生成任务中的强大潜力。这种创新的思路可能会为未来的LLM应用奠定坚实基础。