NeFut Logo NeFut
EN 管理员登录

[AI学术] LaCache:为扩散大型语言模型提供精准缓存与自适应推理

发布于:2026-07-21 22:00 最后更新:2026-07-22 01:01
#Machine Learning #optimization #C++

摘要

扩散基础的大型语言模型(DLLMs)通过半自回归(SAR)解码实现文本生成的并行化。然而,目前的方法在操作层面上存在严重的冗余:在去噪步骤中,它们重新计算整个序列,忽略了前缀和被掩蔽后缀在一个块内是恒定的。我们提出了LaCache,这是一种无需训练的加速框架,通过无损缓存和混合精度来缓解这种冗余。

具体而言,LaCache采用无损状态备忘(Lossless State Memoization,LSM)技术,缓存三种类型的中间结果:

  1. EmbedCache:用于嵌入输出的缓存;
  2. RoPECache:用于逐token的预注意力状态的缓存;
  3. FACache:用于FlashAttention中的在线softmax统计数据的缓存。

这些缓存允许模型在不改变输出的情况下跳过对未更改token的冗余计算。为了进一步缓解内存带宽瓶颈,LaCache为前馈网络(FFN)层集成了一种按组的FP8量化策略,旨在针对扩散过程中的步骤依赖激活分布进行优化。

实验表明,单独使用LaCache实现了比普通DLLM大约1.3倍的端到端加速。当与现有加速方法结合时,LaCache的端到端加速可达到40.2倍,同时保持相似的任务准确性。

博主点评: LaCache的提出不仅有效解决了当前DLLM在计算上的冗余问题,还通过无损缓存技术和混合精度策略,实现了显著的性能提升。这为大型语言模型的高效推理提供了新的思路,值得关注和深入研究。

原文链接: https://arxiv.org/abs/2607.16339

[h] 返回首页