推测解码通过让轻量草稿模型提前生成候选 token,目标模型并行验证,从而加速自回归生成。其无损保证推动了草稿模型向并行生成的方向发展。最新的块并行生成草稿范式包括基于扩散的 DFlash、DSpark,在日常聊天任务上可提升至 3.6 倍。文本大模型已有大量研究,但该技术在多模态模型中的可行性尚未明确。已有工作聚焦于输入压缩、适配器对齐、候选覆盖或特定模态的验证,块并行生成草稿仍少有探索。
为填补空白,本文先进行模态中心的调查,再做跨架构实证研究,核心问题是:多模态推测解码是否已准备好采用基于扩散的并行草稿?我们系统分析了 Vision‑Language、Video‑Language、Audio、Vision‑Language‑Action 等模型,从草稿并行度和跨模态信息交互两方面进行评估。提出统一分类,将草稿侧并行性与树构建、验证策略等正交设计分离。随后在 OCR、VQA、视觉推理、图像描述等标准多模态基准上,对现有方法在不同并行度下进行全面比较。
最后总结当前方法的局限,讨论开放挑战,并展望未来研究方向。
博主点评:本文梳理清晰,提供了多模态推测解码的全景视图和实证数据,为后续研究指明了方向。