NeFut Logo NeFut
EN 管理员登录

[AI学术] 基于输出重要性的残差稀疏化用于压缩混合专家大模型

发布于:2026-09-02 22:00 最后更新:2026-09-03 02:56
#AI #optimization #LLM

Mixture‑of‑experts(MoE)架构通过让不同专家处理不同子任务,实现了大语言模型的高效扩展,但也带来了巨大的 GPU 显存需求。为降低显存占用,常用残差稀疏化对每个专家的投影矩阵进行压缩:先拆分为共享基矩阵和专家专属残差矩阵,再对残差进行稀疏化处理。现有方法在压缩时独立最小化每个残差矩阵的压缩误差,等价于最小化每个投影矩阵的误差。然而,专家的最终输出是多个投影和隐藏表示耦合计算的结果,单个矩阵的微小误差会在隐藏层传播并相互放大,导致输出误差显著上升,进而削弱模型精度。

为消除这种目标错位,我们提出 PARSER。该方法不再关注孤立的矩阵误差,而是以保持专家输出误差为目标,引入输出重要性度量,量化每个残差对最终输出误差的实际贡献。压缩过程依据该重要性分配稀疏化力度,使得对关键残差的保留更充分,对次要残差的压缩更激进。

实验在 Qwen 与 DeepSeek 两套基准上进行比较。相同的峰值显存削减下,PARSER 将压缩后模型与未压缩模型的精度差距分别缩小至原来的 1.41 倍和 1.44 倍,显著提升了压缩效果。

点评:PARSER 通过对输出重要性的精准衡量,实现了压缩目标与模型性能的更好对齐,为大规模 MoE 模型的高效部署提供了实用思路。

原文链接: https://arxiv.org/abs/2609.00575

[h] 返回首页