摘要
知识密集型多模态问答(KI-MMQA)位于三个资源密集型原语的交汇处:长视觉令牌序列、大规模外部语料库的密集检索,以及完全的跨模态融合。现有系统在每个查询中均匀支付这三种成本,尽管对于特定问题,只有一小部分的视觉内容和检索知识实际上是相关的。
我们引入了SKIP(Salient Knowledge-Injected Pathways),一种统一的推理架构,沿着稀疏路径进行计算,这些路径共同依赖于问题、图像和难度估计。SKIP结合了基于问题的视觉令牌修剪、区域条件稀疏检索、二分稀疏跨注意力以及具有自适应预算控制器的推测性知识验证,该控制器根据预测的问题难度分配计算资源。
我们推导出一个信息瓶颈界限,显示在现实的问题-图像互信息假设下,最佳视觉稀疏率的规模为 $O(1/\sqrt{N})$,并保持准确性保证。在五个KI-MMQA基准(OK-VQA, A-OKVQA, InfoSeek, Encyclopedic-VQA和ViQuAE)上,SKIP的准确率与强大的密集基线相匹配或超过,同时使用了 $3.4$--$6.8\times$ 更少的FLOPs和 $2.7\times$ 更少的端到端延迟。
代码可在此获取:SKIP代码库
博主点评: SKIP架构通过稀疏化计算路径有效降低了资源消耗,展现了在多模态问答任务中优化计算效率的巨大潜力。该方法不仅提高了处理速度,同时也保持了高准确率,具有广泛的应用前景。其自适应预算控制策略尤其值得关注,能够根据问题的复杂性动态调整计算资源,确保了系统的灵活性与响应速度。