摘要
扩散基础的大型语言模型(DLLMs)通过半自回归(SAR)解码实现文本生成的并行化。然而,目前的方法在操作层面上存在严重的冗余:在去噪步骤中,它们重新计算整个序列,忽略了前缀和被掩蔽后缀在一个块内是恒定的。我们提出了LaCache,这是一种无需训练的加速框架,通过无损缓存和混合精度来缓解这种冗余。
具体而言,LaCache采用无损状态备忘(Lossless State Memoization,LSM)技术,缓存三种类型的中间结果:
- EmbedCache:用于嵌入输出的缓存;
- RoPECache:用于逐token的预注意力状态的缓存;
- FACache:用于FlashAttention中的在线softmax统计数据的缓存。
这些缓存允许模型在不改变输出的情况下跳过对未更改token的冗余计算。为了进一步缓解内存带宽瓶颈,LaCache为前馈网络(FFN)层集成了一种按组的FP8量化策略,旨在针对扩散过程中的步骤依赖激活分布进行优化。
实验表明,单独使用LaCache实现了比普通DLLM大约1.3倍的端到端加速。当与现有加速方法结合时,LaCache的端到端加速可达到40.2倍,同时保持相似的任务准确性。
博主点评: LaCache的提出不仅有效解决了当前DLLM在计算上的冗余问题,还通过无损缓存技术和混合精度策略,实现了显著的性能提升。这为大型语言模型的高效推理提供了新的思路,值得关注和深入研究。