NeFut Logo NeFut
EN 管理员登录

[AI学术] Minima-KV:保留记忆的 KV 缓存压缩与混合格式分页注意力

发布于:2026-08-26 22:00 最后更新:2026-08-29 12:04
#AI #Machine Learning #LLM

KV 缓存是长上下文大模型服务的主要容量和带宽瓶颈。我们提出 Minima‑KV,一种保留记忆的层次结构,用于混合格式分页注意力。最近且受保护的 Anchor 页面保持 FP8 格式,较旧的非 Anchor 页面则压缩为打包的 TQ3;所有活跃请求的页面仍可寻址。针对不同格式的内核计算部分注意力状态,并通过全局归一化的在线 softmax 合并,实现直接的异构解码,无需缓存大小的密集影子。

在单块 96 GB NVIDIA RTX PRO 6000 Blackwell GPU 上,对不同配置的 Qwen3.6‑27B 进行实验。部署报告每个活跃 token 只占用 18.3 KiB KV,较 BF16 压缩 3.50 倍,较 FP8 压缩 1.75 倍。质量评估在 16 K RULER 针对性检索任务上与密集基线持平。在同一套 503 题 LongBench v2 上,16 K、32 K、64 K 长度的误差分别为 -0.80、-0.60、-0.40 个百分点。

另一个单对直接解码的金丝雀实验使用两条 59 008 token 请求,测得活跃 KV 压缩 3.625 倍,吞吐率为基线的 0.9821 倍,所有 16 层全注意力均无回退且不保留密集影子。这些结果表明,混合格式路径能够在不驱逐活跃请求 KV 页的前提下,实用地压缩长上下文状态。

博主点评:Minima‑KV 在保持解码质量的同时,实现了显著的 KV 压缩,是长上下文 LLM 部署的一个重要突破。

原文链接: https://arxiv.org/abs/2608.23834

[h] 返回首页