三元大语言模型(LLM)将每个权重限制在 $\{-1,0,+1\}$ 三个符号中,传统上以信息论极限 $\log_2 3 \approx 1.585$ 位/权重来衡量其存储成本。实际部署中常用五三进制打包,即把五个三元权重放入一个字节,导致有效位宽上升至 $1.625$ 位/权重,这一数值假设三种符号等概率出现。我们统计了 29 种三元 LLM 的权重分布,发现零值比例最高可达 $51.5\%$。基于此观察,提出 BITCOS——一种基于稀疏分布的布局方案,由密集存在位图和压缩符号向量组成,零密度为 $z$ 时每个权重的存储成本为 $2 - z$ 位。实验表明,在 29 个模型中有 26 个模型的存储密度优于五三进制打包,最稀疏模型的位宽降至 $1.485$ 位。BITCOS 兼容现代 CPU 与 GPU 的高效解包,我们给出针对 AVX‑512、AVX2 以及 Intel Xe2 GPU 的优化解包序列。与业界最优的三元矩阵‑向量乘实现对比,在真实模型的零密度下,使用 BITCOS 可实现最高 $1.28\times$ 的算子加速。端到端推理实验覆盖 5 种平台(客户端/服务器 CPU、集成与离散 Xe2 GPU),解码吞吐在 CPU 上提升至 $1.18\times$,在 GPU 上提升至 $1.27\times$。
点评:BITCOS 通过利用零值高占比,实现了显著的存储压缩和推理加速,为三元 LLM 的实际部署提供了实用路径。