NeFut Logo NeFut
EN 管理员登录

[AI学术] 桥接 LLM 服务与 CXL‑SSD 的块感知 KV 缓存管理

发布于:2026-09-25 22:00 最后更新:2026-09-28 00:49
#Machine Learning #LLM

在LLM服务中,前缀缓存需要大容量,而NAND‑backed存储能够提供所需空间。但块I/O路径会产生CPU缓存争用、主机DRAM中转以及NAND本身的延迟。即使将存储介质换成DRAM,接口开销仍然显著,这促使我们考虑使用CXL‑SSD实现对NAND容量的字节寻址访问。实验表明,普通CXL‑SSD的吞吐仍比本地DRAM慢约3倍,且不优于NVMe SSD,通用预取也收效甚微。为此我们设计了 LM‑CXD,一款面向LLM前缀缓存的CXL‑SSD。LM‑CXD 在服务引擎与设备之间建立语义桥梁:服务端知道哪些 KV 块将被使用,设备负责这些块的放置与迁移。它将 KV 块定义为设备可见的 I/O 单元,向服务端暴露 NAND→DRAM 的进度,并把设备内部的 DRAM 用作 GPU 可直接访问的缓冲区。LM‑CXD 进一步通过窗口化预取协调请求调度,并将层级 KV 的迁移与 GPU 计算流水线化,以在有限的设备 DRAM 下隐藏 NAND 延迟。

在五个 LLM 模型的测试中,LM‑CXD 在使用异步计算预取时将平均 TTFT 提升至原 CXL‑SSD 的 2.6 倍,在层级预取时提升至 4.03 倍,整体 TTFT 接近本地 DRAM(约 1.5 倍)。

点评

原文链接: https://arxiv.org/abs/2609.26828

[h] 返回首页