超低比特语言模型可以显著降低存储和内存带宽,但“1.58 位”这种标称并不能完整描述模型的存储形式、保留能力或运行时行为。本文对指令微调的 4B 参数 Qwen 模型进行端到端的训练后转换,核心技术包括 KOTMS 旋转、E2M‑ATQ 三值化以及来自 TWLA 的 GPTQ 风格误差补偿。转换仅针对权重,激活保持 16 位精度,因而省略了 ILA‑AMP 步骤。我们从有效比特、任务能力保持、困惑度、校准敏感度、检查点组成以及部署行为等维度进行评估。最终的量化线性层使用 1.641 有效比特/权重,覆盖 81.62% 的模型参数。十项能力基准的准确率从 64.5% 降至 54.7%,下降并不均匀:BoolQ 保持 84.6% 的教师性能,而 ARC‑Challenge 仅为 43.8%。困惑度在 WikiText‑2 上从 13.639 上升至 18.748,PTB 从 24.700 上升至 31.992,C4 从 19.831 上升至 28.966。随后进行的打包保留了三值平面和尺度,将模型体积从 8.29 GiB 压缩至 3.96 GiB,困惑度基本不变。第三方的打包尝试出现了信息损失,未计入主要工件声明。压缩后的工件尚未在端到端任务准确率或生成吞吐量上进行基准测试。初步的 Triton GEMV 微基准显示,在一种形状下速度比 FP16 cuBLAS 慢 4.6 倍。因此我们不主张压缩本身即可带来更快的推理。
点评