在KV缓存压缩方法的评估中,通常采用查询附加到上下文后进行压缩的协议,即查询感知协议。然而,压缩KV缓存的经济理由在于重用:对一个文档进行一次压缩,可以回答未来对其的多个问题。因此,在实际应用中,压缩必须在查询不可知的情况下进行,即在任何问题被看到之前。
我们对六种已发表的压缩方法与三种简单基线进行了一次匹配预算审计,使用了三种开放的7-9B模型(在RULER-8192上进行144,300次配对评估;在LongBench上进行40,800次评估;在整个过程中进行50,000次重采样配对自助法)。在审计中,除了评分规则外,所有条件都保持固定,包括模型、压缩比率和实例解码。
我们得出了三项主要发现:
-
查询可见性改变了排名:在不可知协议下,五种共享相同注意力后端的审计方法中,只有KeyDiff在36个单元中有31个表现优于最佳的三种简单基线,而最广泛使用的方法SnapKV则在平均上输给了“保留开始和最近窗口”的方法(-0.066)。
-
不同方法在两种协议下的表现下降顺序与每种方法评分信号中问题的可见性一致,这一点在其源代码中可见:从SnapKV的Delta=+0.198(问题位于其64个标记的观察窗口内)到KeyDiff的Delta=+0.011(其评分中根本没有查询项)。
这些发现揭示了在KV缓存压缩评估中,查询可见性的重要性以及如何影响不同方法的性能表现。
博主点评: 本文通过匹配预算审计,深入探讨了查询可见性对KV缓存压缩方法排名的影响,揭示了压缩策略在实际应用中的重要性,尤其是在重用场景下。研究结果为进一步优化压缩算法提供了重要的参考依据。