NeFut Logo NeFut
EN 管理员登录

[AI学术] 颠覆性KV选择方法:MM-ShiftKV在多模态大语言模型中的应用

发布于:2026-07-28 22:00 最后更新:2026-07-29 01:08
#AI #Machine Learning #optimization

摘要

在多模态大语言模型(MLLMs)中,键值(KV)缓存对高效推理至关重要,但其内存占用随着上下文长度线性增长,成为由于大量视觉标记而形成的主要瓶颈。近期的预填充阶段KV选择方法通过预填充统计来估计KV的重要性,隐含假设预填充时的查询代表了解码过程中遇到的查询。

然而,我们发现这一假设在多模态推理中失效,因为解码时的查询展现出显著更大的方差,从而导致在严格缓存预算下的KV重要性估计不稳定。小的排名错误可能会不成比例地丢弃语义上关键的视觉标记,进而降低基础和推理性能。

我们提出了MM-ShiftKV,这是一种无训练、解码感知且严格基于预填充的KV选择方法。MM-ShiftKV通过构建方差扩展的查询代理,在预填充阶段近似解码时的查询行为,并基于其聚合的注意力质量估计提示KV的重要性。实验结果表明,MM-ShiftKV在严格的KV缓存预算下,始终优于现有方法。我们的代码可在 GitHub 获取。

博主点评: MM-ShiftKV的设计突破了传统KV选择方法在多模态推理中的局限性,通过引入解码感知机制,显著提升了模型的推理稳定性和性能。这一创新将为未来的多模态模型优化提供新的思路和方法。

原文链接: https://arxiv.org/abs/2607.22586

[h] 返回首页