NeFut Logo NeFut
EN 管理员登录

[AI学术] Polestar:创新的漂移感知缓存校准与令牌承诺提升扩散LLM推理效率

发布于:2026-07-18 22:00 最后更新:2026-07-22 01:24
#algorithm #AI #optimization

摘要

扩散大型语言模型(dLLMs)的推理效率受到两个主要挑战的限制:双向注意力机制阻碍了高效的KV缓存重用,而通过静态置信度阈值增加解码并行性又可能影响生成质量。

我们观察到这两个挑战源于一个共同现象:随着令牌的解码,其通过双向注意力的上下文整合导致令牌表示在解码步骤中发生漂移(演变)。这一见解促使了Polestar的提出,作为一个无训练的推理框架,利用令牌表示的漂移作为统一信号来共同解决这两个挑战。

Polestar包含两个组件:

  1. Polestar-Cache:通过漂移识别过时的KV缓存位置,并执行稀疏KV缓存刷新,以实现高效重用。
  2. Polestar-Commit:检测明显的漂移事件,以可靠地识别准备提交的令牌。

在多个dLLM系列的数学和编码基准测试中,Polestar在准确性-吞吐量的Pareto前沿上设定了新的状态,准确性提高了10.73%,吞吐量提高了3.7倍,解码并行性达到每次前向传播3.67个令牌,超越了现有基准。

博主点评: Polestar通过关注令牌表示的漂移,巧妙地解决了传统推理中的效率瓶颈,展现了其在实际应用中的潜力。这一创新方法不仅提升了推理性能,同时也为未来的LLM优化提供了新的研究方向。

原文链接: https://arxiv.org/abs/2607.14107

[h] 返回首页