长输出推理使得键值(KV)缓存成为高效 LLM 服务的关键内存瓶颈。现有 KV 压缩方法通常基于预设的每请求预算,只在保留哪些 KV 状态上做调整,导致整个解码过程的总容量保持不变。然而推理任务的需求波动显著:不同请求需要的 KV 容量不同,单个请求在生成过程中的注意力需求也会随时间变化。
GrowPage 将 KV 容量视为运行时资源,提供按需预算框架。它维护轻量的双时间尺度查询摘要,分别捕获近期和长期的注意力行为,并利用它们的相对注意力工作集估计需求演化。在每个容量边界,GrowPage 要么在当前分配内压缩 KV 状态,要么在需求扩大时获取额外的物理页。通过与 PagedAttention 的页级内存抽象结合,GrowPage 保持连续批处理和前缀缓存不受影响。
在多个模型的推理基准上实验表明,GrowPage 在性能与吞吐之间实现了优于现有方法的平衡。
点评:GrowPage 通过动态调配 KV 资源,有效缓解了长序列推理的内存压力,为大模型服务提供了更灵活的资源管理方案。