NeFut Logo NeFut
EN 管理员登录

[AI学术] 不要丢弃 Dropout:优化层稀疏以提升 LLM 训练与推理效率

发布于:2026-09-08 22:00 最后更新:2026-09-09 09:08
#Machine Learning #optimization #LLM

层 dropout(又称随机深度)在语言和视觉 Transformer 中已被证明能加速训练、提升精度并增强对零样本层剪枝的鲁棒性。随着模型和数据规模的扩大,层 dropout 在大语言模型(LLM)预训练配方中几乎消失。已有工作指出 dropout 可能降低精度,但缺乏系统量化和缓解方案。本研究系统评估层 dropout 在最先进 LLM 训练中的作用,给出最佳实践和尺度分析。实验在 Cerebras CS‑3 上完成,覆盖 271M‑8.2B 参数、160B token 数据,共计 2400 多次训练。

关键发现包括:在相同 FLOPs 下,使用最佳层分布、时间调度和优化器超参数的层 dropout 可显著降低训练损失;在固定训练步数下,层 dropout 能在保持或降低验证损失的同时节省最高 25% 的训练 FLOPs。层 dropout 还支持多种后训练加速技术,如提前退出、跳过中间层和自我推测解码,使推理速度提升至 1.5 倍,精度损失可忽略不计。

综上,层 dropout 应重新纳入 LLM 预训练流程,并可在训练和推理阶段带来显著效率收益。

点评

原文链接: https://arxiv.org/abs/2609.05275

[h] 返回首页