在多模态推理中,效率不仅受模型质量或FLOP数量的限制,还受到在延迟、内存和能量约束下,保留、移动、路由、缓存和量化多模态表示的成本影响。本文回顾了在高效视觉-语言和多模态大型语言模型方面的最新进展,涵盖了视觉令牌压缩、视频令牌管理、KV缓存优化、专家混合(MoE)路由、低位量化、边缘部署和硬件感知基准测试等内容。
我们认为,这些技术不能被视为独立的优化。视觉令牌压缩会改变下游特征分布和MoE路由决策,路由行为影响专家利用率和量化敏感性,量化路由器的logits影响专家分配,KV缓存策略决定保留的多模态证据,而硬件限制往往将计算节省转变为内存和通信瓶颈。
我们围绕这些相互作用组织了文献,并识别了关键的设计权衡,包括准确性与令牌预算、静态与自适应压缩、稀疏路由效率与专家崩溃、低位推理与特定模态退化。最后,我们引入了时间路由一致性作为视频MoE模型的诊断工具,并强调了在路由感知压缩、跨模态缓存管理、硬件感知协同设计和多模态边缘智能统一基准测试等领域的开放研究方向。
博主点评: 本文深入探讨了多模态智能中的各类优化技术的相互影响,揭示了在实际应用中必须综合考虑的复杂性。尤其是强调了硬件限制与算法优化之间的微妙关系,为未来的研究提供了重要的视角。