摘要
扩散多模态大语言模型(DMLLMs)在多模态推理中表现出色,但其推理效率受到固定长度生成约束的显著影响。由于实际输出长度未知,输出序列需填充至预定义的最大长度,导致在不必要的 [EOS] 令牌上产生大量冗余计算。
本文发现,DMLLMs 在第一步去噪过程中通过 MLP 激活稀疏性的显著变化,隐含揭示了其有效语义边界。基于这一观察,我们提出了 Seer,一个无训练的框架,利用信噪比(SNR)标准检测此边界,并对后续计算进行一次性截断冗余后缀。
为了在批量服务中保留这些理论收益,Seer 采用混合执行策略,最大化吞吐量,同时顺利适应动态序列长度。实验结果表明,Seer 有效消除了填充浪费,吞吐量提升高达 $31\times$。在 9 个基准测试中,Seer 稳定保持整体性能,甚至通过减少噪声泄漏提高复杂视觉任务的准确性(例如,DocVQA 分数从 63.52 提升至 63.66),为 DMLLM 加速提供了一种高效的即插即用解决方案。
博主点评: 本文通过创新性的方法解决了 DMLLMs 中固有的冗余计算问题,提供了一种高效且实用的加速方案。通过稀疏性感知的截断,Seer 不仅提升了吞吐量,还在复杂任务中保持甚至提升了准确性,展示了其在实际应用中的潜力。此研究为多模态推理领域的进一步发展奠定了基础。