NeFut Logo NeFut
EN 管理员登录

[AI学术] ExTernD: 精确接近任意量化级别的扩展秩三元分解技术

发布于:2026-07-17 22:00 最后更新:2026-07-18 08:19
#AI #Machine Learning #optimization

我们介绍了 ExTernD(扩展秩三元分解),这是一种后训练的权重矩阵分解方法。对于每个 LLM 权重矩阵 $A \in \mathbb{R}^{m \times n}$,我们有 $A \approx B \operatorname{diag}(D) C$,其中三元因子 $B \in \{-1,0,+1\}^{m \times k}$,$C \in \{-1,0,+1\}^{k \times n}$,以及实数尺度向量 $D \in \mathbb{R}^k$。

为了纠正早期的量化误差,内秩 $k = \mu \min(m,n)$ 被故意扩展超出满秩($\mu > 1$)。我们证明了残差在 $k$ 中单调递减,并且可以被驱动低于任意 $\varepsilon > 0$:ExTernD 可以任意接近 bf16 的精度,而没有固定平面计数的三元方案能够做到这一点。

内存和计算量随着 $\mu$ 线性增长,而因子稀疏性则随着阈值 $\tau$ 线性变化,因此精度目标是精确达到,而不是四舍五入到下一个位宽。ExTernD 在 Gemma-4-E2B 和 Qwen3.5-4B 上的每个矩阵准确度与 Q4_K 相匹配,达到 5.2-5.5 有效位宽(5.1-5.5,带重要性加权),并且在 $\mu = 3$ 时,完整的 Qwen3.5-4B 转换在 wikitext-2 的困惑度达到 10.10,相比于 9.78 的 bf16 精度提高了 3.2%,将其置于 ~5.7 有效位宽的 Q4_K/Q5_K 精度带附近。

博主点评: ExTernD 的创新之处在于其扩展的内秩设计,能够有效纠正量化误差,提供接近 bf16 的高精度。这一方法在 LLM 后训练量化过程中具有重要的实用价值,尤其是在内存和计算资源有限的场景下,展现出强大的灵活性和适应性。其性能表现也为未来的量化技术提供了新的思路。

原文链接: https://arxiv.org/abs/2607.13511

[h] 返回首页