摘要
Fisher 信息是表征神经网络参数敏感性的重要概念。然而,利用完整的观察 Fisher 信息对于大型模型而言成本过高,因此大多数方法依赖于简单的对角线近似。虽然这种方法高效,但忽视了参数间的相关性,往往导致下游任务性能降低。
在本研究中,我们提出了一种名为广义 Fisher 加权 SVD(GFWSVD)的后训练 LLM 压缩技术,该技术考虑了 Fisher 信息矩阵的对角和非对角元素,从而更准确地反映参数的重要性。为使该方法可行,我们引入了 Kronecker 因式分解近似算法的可扩展适配,以处理观察到的 Fisher 信息。
我们在 LLM 压缩上展示了该方法的有效性,结果表明其超越了现有的压缩基准。例如,在 MMLU 基准上以 20 倍的压缩率,我们的方法比基于对角近似的 FWSVD 提高了 5%,比 SVD-LLM 提高了 3%,比 ASVD 提高了 6%。
博主点评:GFWSVD 方法通过考虑 Fisher 信息的全貌,显著提升了模型压缩效果,尤其在大型语言模型的应用上,展现出其强大的潜力。此方法为后续研究提供了新的思路,值得深入探索与应用。