NeFut Logo NeFut
EN 管理员登录

[AI学术] 多模态推测解码准备好用于基于扩散的并行草稿吗?调查与实证诊断

发布于:2026-08-24 22:00 最后更新:2026-08-29 12:04
#AI #Machine Learning #Neural

推测解码通过让轻量草稿模型提前生成候选 token,目标模型并行验证,从而加速自回归生成。其无损保证推动了草稿模型向并行生成的方向发展。最新的块并行生成草稿范式包括基于扩散的 DFlash、DSpark,在日常聊天任务上可提升至 3.6 倍。文本大模型已有大量研究,但该技术在多模态模型中的可行性尚未明确。已有工作聚焦于输入压缩、适配器对齐、候选覆盖或特定模态的验证,块并行生成草稿仍少有探索。

为填补空白,本文先进行模态中心的调查,再做跨架构实证研究,核心问题是:多模态推测解码是否已准备好采用基于扩散的并行草稿?我们系统分析了 Vision‑Language、Video‑Language、Audio、Vision‑Language‑Action 等模型,从草稿并行度和跨模态信息交互两方面进行评估。提出统一分类,将草稿侧并行性与树构建、验证策略等正交设计分离。随后在 OCR、VQA、视觉推理、图像描述等标准多模态基准上,对现有方法在不同并行度下进行全面比较。

最后总结当前方法的局限,讨论开放挑战,并展望未来研究方向。

博主点评:本文梳理清晰,提供了多模态推测解码的全景视图和实证数据,为后续研究指明了方向。

原文链接: https://arxiv.org/abs/2608.20743

[h] 返回首页