NeFut Logo NeFut
EN 管理员登录

[AI学术] PRESTO:前缀对齐树草拟技术提升扩散推测解码效率

发布于:2026-07-28 22:00 最后更新:2026-07-29 01:08
#algorithm #AI #Machine Learning

摘要

扩散大语言模型(dLLMs)作为自回归(AR)LLMs的有力替代方案,能够并行生成标记,因而在推测解码(SD)中表现出色,能够在单次前向传递中生成整个草拟标记块。然而,现有的基于扩散的草拟方法依赖于线性草拟,尽管dLLMs在各个位置上发出多个候选标记,这导致了解码路径的组合空间大幅增加,从而限制了接受长度和解码效率。为利用这种多候选结构,我们将树状草拟应用于扩散草拟器,从而能够探索多样的候选路径。

然而,我们发现,简单的树草拟方法并不理想:扩散边际是前缀盲的,与基于前缀的AR验证不匹配,导致路径排名不可靠。为此,我们提出了PRESTO,一个原则性的框架,扩展了树状草拟至扩散草拟器,同时解决了扩散草拟信心与基于前缀的AR验证之间的根本不匹配问题,通过前缀对齐评分和基于优先级的树搜索来实现扩散推测解码。

PRESTO的关键原则包括:(1)候选排名应与基于前缀的AR验证对齐;(2)树的构造应优先考虑具有高验证潜力的候选路径,以最大化接受长度。大量实验表明,PRESTO在最先进的专用扩散草拟器SD上实现了高达$1.5\times$的端到端吞吐量加速,在自推测扩散LLMs上实现了$1.12\times$的加速,涵盖多种基准测试。

博主点评: PRESTO框架的提出不仅提高了扩散模型的解码效率,还通过针对性地解决前缀对齐问题,展示了在复杂解码任务中优化路径选择的重要性。这一创新为未来的语言模型研究开辟了新的思路,值得关注。

原文链接: https://arxiv.org/abs/2607.22634

[h] 返回首页