摘要
大型语言模型(LLMs)以自回归方式生成文本,依赖于一个关键值(KV)缓存,其内存占用随着上下文长度线性增长,造成了主要瓶颈。虽然近期的压缩方法通过令牌合并来减轻这一成本,但这些方法往往依赖于不加区别的聚合,导致表示能力下降并引入注意力衰减,即合并的令牌在接收与单个令牌相同的softmax质量时,编码了多个输入的不匹配现象。
我们提出了一种无训练的双组件框架,用于KV缓存压缩,解决了这些局限性。首先,采用一个软余弦门,根据值向量相似性自适应调节合并决策,抑制或丢弃不相似的令牌,以保持语义的保真性。其次,我们引入了一个注意力比率补偿机制,应用于解码时的logit偏置,该偏置源自预填充注意力统计数据,修正了因合并引起的softmax不平衡。
在LongBench(16个英语数据集)上的评估表明,尽管仅保留25%的KV缓存,我们的框架在压缩性能上对比典型的一次性基线表现优异。尤其在评估的分组查询注意力(GQA)模型上,保持了近乎无损的生成质量。此外,该方法在复杂的多文档问答任务中优于全缓存基线,并在处理10万个令牌时实现了3.3倍的解码速度提升。
博主点评: 此项研究通过引入选择性合并和注意力补偿机制,有效解决了KV缓存压缩中的几个关键问题,展现了在大规模文本生成任务中的应用潜力,值得关注。