NeFut Logo NeFut
EN 管理员登录

[AI学术] FlowBlock:自我修正扩散语言模型的波前并行解码革命

发布于:2026-07-22 22:00 最后更新:2026-07-23 12:33
#algorithm #AI #Machine Learning

摘要

块级扩散大语言模型(dLLMs)在块级别上顺序解码,这使得跨块的有效 KV 缓存重用成为可能,但也使得跨块解码严格串行。之前的研究尝试通过后训练方法解锁跨块并行性,但仅实现了适度的加速,且常常降低了准确性。我们观察到自我修正的 dLLMs 提供了一个无训练的替代方案:通过 token-to-token (T2T) 编辑,可以修复使用稍微过时的上游上下文草拟的 token,因此下游块只需一个信息丰富的草稿,而不是一个最终化的前任。这将块的最终性从硬依赖转变为调度资源。

我们提出了 FlowBlock,一个基于两种机制的无训练并行解码框架。1. 门控波前解码:仅在满足就绪门时,允许块进入有限波前,同时通过 T2T 编辑共同细化活动块,并在窗口化块因果掩码下按顺序提交块,从而保持精确的冻结前缀 KV 缓存重用。2. 异构波前打包:为每个请求分配一个独立的波前,同时将异步窗口打包成密集的、形状稳定的批量前向。

在不同基准测试中,FlowBlock 在 LLaDA-2.1 和 LLaDA-2.0 两个串行块级 dLLMs 上提高了每秒 token 数(TPS)最多 2.95 倍和 4.01 倍,同时将延迟减少最多 53.6% 和 77.1%。它还提高了平均准确性 1.3 分。与基于训练的跨块并行基线 D2F 相比,FlowBlock 实现了更高的准确性和高达 16 倍的批量服务吞吐量。

博主点评: FlowBlock 的提出无疑是对扩散语言模型领域的一次重大突破。通过无训练的方式实现并行解码,不仅提高了处理速度,还兼顾了模型的准确性,展现了未来语言模型发展的新方向。其创新的 T2T 编辑机制为快速适应上下文变化提供了可能,值得深入研究与应用。

原文链接: https://arxiv.org/abs/2607.17652

[h] 返回首页