NeFut Logo NeFut
EN 管理员登录

[AI学术] LinearKV:一种适用于混合LLM的位置无关缓存框架

发布于:2026-08-13 22:00 最后更新:2026-08-14 00:05
#LLM #Hybrid LLMs #Position-Independent Caching #LinearKV #HYPIC

LinearKV是一种训练免费的混合位置无关缓存(PIC)框架。其核心思想是将每个线性层的$K$个匹配的局部状态映射到一个单一的初始状态,而全注意力层则像以前一样连接其KV。因此,LinearKV与现有的PIC方法兼容,可以直接复用它们的令牌选择和重新计算。 实验结果表明,单一缓存状态就足以作为线性层的初始化。我们比较了LinearKV和另一种方法HYPIC,后者尝试组合所有$K$个缓存状态来获得精确的全前缀状态。在三个混合模型和三个PIC选择器上进行的实验表明,LinearKV在两个GDN模型上与HYPIC相当,恢复了大部分的全质量(最高达$92%$);而在Mamba-2模型上,精确组合方法在每个选择器下都出现了崩溃——例如,在EPIC下,它只恢复了$46.6%$的全质量,而LinearKV恢复了$86.8%$的全质量。 此外,单一状态初始化的方法也更廉价,减少了到第一令牌的时间至$0.46 imes$,而精确组合方法则增加了$5$--$17%$的开销。这些结果在LongBench QA和RULER的8K--32K上都成立。 博主点评: LinearKV为混合LLM提供了一种高效的位置无关缓存框架,其单一缓存状态初始化方法不仅能恢复大部分的全质量,还具有更低的计算成本和更快的到第一令牌时间。这使得LinearKV成为混合LLM中的一个有前途的解决方案。

原文链接: https://arxiv.org/abs/2608.11231

[h] 返回首页