NeFut Logo NeFut
EN 管理员登录

[AI学术] 革命性记忆优化:MoA结构解码注意力的四大推导

发布于:2026-07-24 22:00 最后更新:2026-07-26 07:44
#algorithm #optimization #C++

在这篇文章中,我们推导了四个针对变换器注意力的记忆最优推理工件,利用数组数学(MoA),每个工件都直接源自于固定查询行索引的前向传递的描述性标准形式(DNF)。

  1. 单查询解码 DNF:通过 $\tau$-归约代数地消除了 $K^{\top}$ 缓冲区,达到了 $(d_k + nd_k + nd_v + d_v) \times 4 \text{B}$ 的动态随机访问内存(DRAM)流量,数值验证误差为 $\text{err} \|\text{err}\|_{\text{leq}} \leq 2 \times 10^{-7}$。

  2. C/OpenACC GPU 内核:采用操作标准形式(ONF)步幅算术和硬件合并内存访问,验证误差为 $\|\text{err}\|_{\infty} = 0$(精确的 IEEE-754 浮点算术)。

  3. 多步 KV 缓存:每步通过 MoA 连接实现 $O(d_k + d_v)$ 的追加。

  4. 分组查询注意力(GQA)和多查询注意力(MQA):通过 $\tau$-选择推导,证明了在 KV 流量中实现 $\frac{h_q}{h_{kv}}$ 的减少。

所有程序均与 PyTorch 的 scaled_dot_product_attention 进行了验证。

原文链接: https://arxiv.org/abs/2607.19456

[h] 返回首页