在大型语言模型(LLMs)上进行长序列推断的计算开销巨大,主要由于自注意力的二次复杂性。分布式块级方法如星形注意力通过在主机之间分片上下文来降低这一成本,但依赖于在每个主机前添加一个静态的、与内容无关的首个块副本。
我们提出了脉冲注意力,替代静态锚点,使用两个轻量级的、内容感知的组件:一个小型的注意力汇聚前缀,用以稳定softmax,以及通过Max-IDF启发式方法构建的紧凑跨块摘要,选择包含全局稀有令牌的块。
这种方法在RULER和BABILong上与Llama-3.1-8B结合使用时,相较于星形注意力,Phase 1每个GPU的FLOPs最多减少了3.3$\times$,同时保持相同的KV缓存占用。在序列长度达到128K tokens时,脉冲注意力的性能优于星形注意力和密集注意力,相较于密集基线有最高4.7%的绝对增益。
博主点评: 脉冲注意力通过引入内容感知的机制,显著优化了长序列推断的效率,展现了在分布式环境下处理大规模数据的潜力。其Max-IDF策略的创新性值得关注,为未来的模型设计提供了新思路。