Multi‑head latent attention(MLA)通过单一的打包 latent KV 流暴露出大量逻辑查询头。该表示在内存上极为高效,但也打破了传统按头缓存的物理边界,导致常规的 head‑wise 重用失效。我们实现了 RedKnot 的 head‑aware 重用原则,并在 DeepSeek‑V4 上落地。每个不可变文档在离线阶段被处理到规范位置 0,经过认证的 Local‑head 贡献被保存为 MLA‑Off。服务时,查询侧通过 RoPE 重定位恢复文档的实际请求位置,重新计算一小批 Global‑head 与受保护的 Local token 行,形成 MLA‑Online,随后两条路径在同一共享输出投影前合并,整个打包的 MLA latent 从未被拆分。DeepSeek‑V4‑Flash 采用 37 层可复用结构,Local/Global 头部比例为 56/8,理论上可达 75.29% 的逻辑头行上限;Pro‑0813 配置使用 55 层、112/16 头部,达到 78.89%。冻结的 Flash 运行点在热‑artifact TTFT 上实现 2.02‑3.84 倍加速。256K 规模的三数据集归档实验显示,整体 F1 提升 3.24 个百分点,EM 提升 4.16 点,分析性主算子算力节省 78.7‑79.5%,但有一数据集 F1 下降 2.81 点。另有作者报告的 256K 热‑artifact QPS 约为 2.0 倍,由于原始并发追踪未随包提供,故标记为初步证据而非归档。文中还阐述了因式分解、位置修复、token‑row 闭合、稀疏 MoE 支持、TP8 集成以及解释结果所需的测量边界。
点评