投机解码通过使用轻量级草稿模型并行提出多个候选 token,以加速自回归生成。然而,传统方法往往需要额外的草稿模型或权重表示,导致在资源受限设备上出现显著的内存开销。自投机(self‑speculative)方案虽能降低这部分开销,但仍面临草稿质量、目标质量与存储效率之间的权衡。\ \ BitNest 提出一种位嵌套(bit‑nested)投机解码框架,将低精度草稿直接嵌入到更高精度的目标表示中。其核心思路是:先构建一个强大的低精度基模型,然后通过残差细化恢复出高精度目标模型,使两者共享同一套物理权重表示。该设计同样扩展到 KV 缓存,实现长上下文推理的渐进精度管理。\ \ 在多款 7B‑8B 适用于边缘设备的 LLM 以及多样化工作负载上,BitNest 达到 95.2% 的平均投机接受率,几乎保持高精度模型的生成质量,并相较于 FP16 自回归解码实现 1.48‑1.61 倍的端到端加速。对所有主流自投机基线的 LLaMA 系列模型,BitNest 亦保持竞争甚至更高的解码速度提升。\ \ 点评