NeFut Logo NeFut
EN 管理员登录

[AI学术] 压缩三位一体:稀疏、量化与低秩近似在大语言模型压缩中的协同

发布于:2026-08-26 22:00 最后更新:2026-08-29 12:04
#Machine Learning #optimization #Artificial Intelligence

大语言模型(LLM)在计算和能耗上成本高昂,单独使用稀疏、量化或低秩近似往往会在精度与效率之间遇到瓶颈。\ \ 本文提出压缩三位一体框架,将稀疏、量化和低秩近似同步应用:稀疏用于削减算子计算量,量化降低内存带宽需求,低秩近似在两者导致的精度损失上进行补偿。\ \ 在预训练阶段,MKOR 通过块对角稀疏和低秩逆近似曲率矩阵,实现对量化状态的数值稳定性保持,并将曲率更新复杂度从 $O(d^3)$ 降至 $O(d^2)$,相较于 KFAC 收敛速度提升约 1.85 倍。\ \ SLoPe 采用双重剪枝的 N:M 稀疏反向传播,在保持梯度信息的前提下提升训练速度约 1.25 倍;在训练的最后 1% 使用低秩“懒”适配器,帮助恢复因稀疏导致的精度下降。\ \ 后训练压缩方面,OPTIMA 将权重重构建模为全局最优的列式二次规划,在零训练条件下实现静态掩码的最优化,使零样本精度提升约 3.97%。在给定微调预算时,PATCH 学习 0%~50% 的动态混合稀疏比例,突破静态掩码的上限,最高可获得 1.38 倍的加速。\ \ SLiM 在一次性压缩中完整实现三位一体,利用数学推导的低秩适配器弥补量化和稀疏带来的信息缺失,使精度提升约 5.66%,并在相同参数预算下超越未压缩的密集模型 0.6%。\ \ 综上,稀疏、量化与低秩近似的协同作用是实现高效、可扩展 LLM 的关键技术。\ \ 博主点评:三位一体的统一视角让压缩方法不再是相互独立的“补丁”,而是形成相互支撑的体系,尤其在大模型预训练和后训练阶段的实验验证,展示了显著的加速与精度提升,值得在实际部署中进一步推广。

原文链接: https://arxiv.org/abs/2608.24070

[h] 返回首页