块扩散已成为扩展离散扩散语言模型(dLLMs)的主流范式,因为在固定大小块中解码文本能够保持每个块内的并行生成,同时保持二次注意力成本可控。然而,这种效率伴随着结构限制:靠近块末尾的token在生成时无法访问未来的跨块上下文,而一旦块被最终确定,其不确定预测就会成为所有后续块的不可逆上下文。这导致了块边界问题,其中不确定性在块边界处累积,早期错误在后续生成中传播。为了解决这个问题,我们提出了多块编辑(MBE)方法,通过基于跨块上下文编辑已解码的token来缓解这一问题。MBE首先提出了一种无训练解码算法,通过重新打开选定块的全注意力窗口来编辑先前块中解码的token。考虑到块扩散训练与MBE推理之间的注意力机制不匹配,MBE进一步引入了监督微调策略,为模型提供逐步扩展编辑范围的双向注意力掩码。此外,它还扩展了SGLang,利用多形状CUDA图池和细粒度KV缓存控制,使这些可变长度的编辑过程在实践中高效。针对LLaDA2.1-Mini的13个基准测试的实验表明,训练无关的MBE在保持可比吞吐量的同时超越了所有现有的解码基线,而MBE SFT进一步带来了2.7的性能提升。最大改进出现在需要强长程一致性的任务上,包括在AIME 2025上提升13.3和在ZebraLogic上提升5.9,证明了MBE的有效性。
博主点评: 多块编辑(MBE)通过跨块上下文的编辑策略,成功解决了块边界问题,显著提升了模型在长程一致性任务上的表现。此方法的训练无关特性及其高效实现,为未来的语言模型开发提供了新的思路与方向。值得关注的是其在实际应用中的表现,尤其是在需要处理复杂上下文的场景下。