Speculative decoding(推测解码)能够在不改变生成结果的前提下加速文本生成,但在视觉语言模型(VLM)上会陷入自我限制的循环。草稿模型必须保持自回归结构,从而只能保持体积小;体积小的草稿模型无法在每一步都读取完整图像,只能对图像进行压缩、裁剪或隐藏。缺失图像信息的草稿在图像对文本可预测性贡献最大的时刻最不可靠。我们提出 GLANCE,这是首个在未修改的目标 VLM 上实现无损推测的单通道块草稿模型,彻底打破了上述循环。GLANCE 采用块扩散头(block‑diffusion head)直接读取目标模型已经融合的视觉‑语言状态,因而草稿模型不再承担视觉计算开销;一次前向传播即可填满整个块,消除了深度上的顺序步骤。宽度上,候选树在一次目标模型前向中完成验证,所有经审计的提示均与贪婪解码完全一致。对需要强关联的任务尤为受益,进入逐字复制模式时,传统自回归草稿每生成一个 token 都需要一次前向,而块草稿整块只需一次。单引擎、单轮预算下,GLANCE 的解码速度最高可达 $2.93\times$ 于自回归,生产阶段仅需一次草稿传递,而 EAGLE3‑VL 需要八次;在相同语料上训练的 EAGLE‑3 只能接受 $\frac{1}{2.7}$ 长度的块。实验表明,接受块长度由目标模型的下一个 token 熵决定,其斜率随任务的视觉关联度提升而增大,这一定律在不同模型和模态间保持一致,并自然划定了文本仍偏好链式解码的边界。代码已开源:https://github.com/js-lee-AI/GLANCE
点评:GLANCE 通过一次性读取融合状态和块级并行,显著降低了视觉语言模型的推测解码成本,为高效多模态生成提供了可复制的路径。