混合型大语言模型(LLM)将 Softmax 注意力层与线性注意力层(如 Gated DeltaNet,简称 GDN)组合,后者通过递归状态在固定大小的向量中压缩上下文信息。早期社区对 Qwen3.8‑27B(包含 48 层 GDN 与 16 层注意力)的 4 位量化往往把 GDN 块保留在 8‑或 16‑位,尤其是衰减门和写入强度门,原因是担心递归误差在长上下文中会累积。
我们构建了 Minima:NVFP4 W4A4,对全部 496 个线性层(包括 GDN)统一使用 $4$‑bit 量化,并在 4K/32K perplexity、MMLU‑Pro、GSM8K、AIME'25、GPQA‑Diamond、LiveCodeBench、RULER 检索(最长 64K)等任务上进行评估。结果显示,Minima 在种子噪声范围内与 BF16 基准持平(5 项任务平均差 $-0.52$),且模型体积最小($17.5\,\text{GiB}$),预填充速度提升 $14\%\sim19\%$。在 32K 长度下的 perplexity 差距随位置递减。
为解释这一现象,我们展开了四部分机制分析:
- NVFP4 的 $16$ 元素块缩放将残差流中的极端离群值局部化,使不同层角色的激活误差趋于一致;
- 看似脆弱的门控投影实际上最不敏感——软加/指数和 sigmoid 参数化将约 $11\%$ 的 GEMM 误差压缩至约 $2\%$ 的输出误差;
- Delta‑rule 递归在注入噪声后保持平坦平台约 $32\,\text{k}$ token,并在数百步内忘记状态冲击,因为每次写入都会沿当前键方向覆盖状态;
- 每 token 的量化成本随上下文长度被稀释,而非累积。
我们还修复了一个全局尺度的不匹配:当为每个模块单独校准的 NVFP4 检查点在融合为单个 GEMM 的内核中使用时,会出现误差偏移。实验表明,校准后的 FP8 KV‑cache 缩放在性能上几乎无代价。
实用配方:全部量化、携带 KV 缩放即可;并提供了递归半部易于量化的机制解释。模型检查点已发布于 https://huggingface.co/minima-ai/mnma_qwen3.8_27b_nvfp4
点评