当大语言模型(LLM)服务的 KV 缓存空间耗尽时,常见的两种解决方案是张量并行和 KV 压缩。张量并行通过在 2、4、8 台设备之间切分模型权重和 KV 缓存来释放显存,但每层都需要一次 all‑reduce,且硬件成本随设备数量线性增长。KV 压缩则在单卡上通过量化和淘汰策略直接缩小缓存,占用更少显存,代价是略有质量下降。
已有工作分别报告了压缩带来的显存比例和并行扩展带来的吞吐提升,却很少把两者放在同一成本坐标上比较。本文基于对 A100、A40、H100 的实测数据构建了模拟器,将张量并行(并行度 1~8)和 KV 压缩(16/8/4 位、保留比例至 0.25)映射到“每百万 token 成本 vs 延迟”这一成本归一化轴上,寻找两者成本等价的交叉点。
实验覆盖 Llama‑2 7B 与 70B 两个模型、三种 GPU 类型以及所有可构造的显存释放方案。结果显示不存在成本等价点:在所有场景下,KV 压缩的成本更低,节约幅度在 1.20×~2.00× 之间。7B 模型在 80 GB 卡上甚至无法在自身上下文窗口内耗尽 KV 缓存,决定采用哪种策略的关键是模型规模相对于显存的比例,约在 80 GB 卡的 36 B 参数左右。模型规模低于该阈值时,压缩优势明显,额外的 GPU 只会造成浪费;超过阈值后,张量并行不再是可选项,而是进入门槛:例如 Llama‑2‑70B 在任何 KV 设置下都无法在单块 A100 上运行,因为受限资源变为模型权重,而 KV 压缩并不影响权重大小。
在延迟方面,张量并行是唯一能够提升每 token 处理速度的手段;相反,压缩会因批处理争用导致每 token 延迟上升 8%~93%。在成本效益上,压缩能够将容量提升约 16.5 倍,而八卡并行仅提升约 1.21 倍。
博主点评:本文通过统一成本视角清晰展示了在显存受限的 LLM 部署中,KV 压缩往往比盲目扩展 GPU 更具性价比,只有在模型规模足够大、权重本身成为瓶颈时才需要张量并行。