NeFut Logo NeFut
EN 管理员登录

[AI学术] MeshKV:面向可扩展Transformer解码加速器的网络芯片KV缓存织构

发布于:2026-09-19 22:00 最后更新:2026-09-20 12:54
#AI #Machine Learning #LLM

Autoregressive Transformer 解码在 tiled 加速器上受 KV 缓存不规则移动限制。传统压缩和 DRAM 放置方案仍把流量集中在中心存储路径,导致长上下文服务出现瓶颈。MeshKV 将 KV 块包装成数据包,在轻量级 NoC 上流动,并通过三项协同设计提升效率。TaKV 采用仿射条纹化,将 KV 块分散到不同节点,降低热点负载。Mare 多播加入经验证的重复抑制,避免冗余传输。Pad 通过信用对齐的 FIFO,将预取、瓦片乘法和流式 softmax 重叠执行,使二分割回压转化为有用的 KV 传输。实验在 8×8 FPGA 上使用 LLaMA‑2‑7B 与 Mistral‑7B,上下文长度 8K‑32K。相较于基线,MeshKV 将互连流量削减最高 58%,KV 带宽利用提升 2.1 倍,多流吞吐提升至 1.9 倍。

点评: MeshKV 在保持计算密度的同时显著缓解了 KV 访问瓶颈,为大模型解码提供了可扩展的硬件路径。

原文链接: https://arxiv.org/abs/2609.19207

[h] 返回首页