NeFut Logo NeFut
EN 管理员登录

[AI学术] TriSP:大型语言模型的三信号结构剪枝技术

发布于:2026-07-28 22:00 最后更新:2026-07-29 01:08
#algorithm #optimization #Neural

摘要

大型语言模型(LLMs)在多种任务上表现出色,但其部署受到参数的内存和计算成本限制。结构剪枝通过移除整个结构(如注意力头和多层感知器(MLP)神经元)来生成更小的稠密模型,从而在标准硬件上高效运行。然而,现有方法依赖于基于梯度的重要性估计(这在内存上是有负担的)或基于激活的统计代理(这些并不直接测量移除对损失的影响)。此外,重要性标准与剪枝后恢复策略之间的相互作用尚未系统研究。

我们提出了 TriSP(三信号结构剪枝),这是一种重要性度量,结合了按激活范数缩放的权重幅度与通过几何平均得出的一级梯度敏感性,生成一个通道级得分,捕捉结构和损失敏感信号。结合每层自适应预算分配和低秩适应(LoRA)恢复,TriSP 在所有测试配置中实现了最低的困惑度和最高的零-shot 准确率,在 LLaMA-7B 上达到 20% 剪枝时的 6.80 WikiText-2 困惑度。在 50% 剪枝的情况下,推理吞吐量提高了 82%,同时保持竞争力性能。

博主点评: TriSP 方法通过综合考虑权重和激活的信号,显著提升了大型语言模型的剪枝效率,这为模型在资源受限环境中的实用性提供了新的可能性。其创新的几何平均策略确保了剪枝过程中的性能保持,使得该方法在实际应用中具有较高的价值。

原文链接: https://arxiv.org/abs/2607.22587

[h] 返回首页