摘要
多模态智能搜索系统日益依赖外部工具来回答知识密集型的视觉问题。然而,现有评估主要集中在最终答案的准确性上,可能会忽视搜索过程中的失败。
在本研究中,我们探讨了隐性可靠性问题,即隐性失败。我们引入了一个六类分类法,涵盖了模态捷径、虚幻定位、错证对正答情况、过度检索洗白、跨模态矛盾和来源幻觉。
基于这一分类法,我们构建了一个轨迹级诊断管道,统一评估答案的正确性和证据定位质量,采用ReAct风格的框架。
实验在四个前沿多模态模型的MMSearch-Plus轨迹上进行,结果显示表面准确性始终高估了真实轨迹级的正确性。
此外,我们还利用跨评估验证、空白图像压力测试和工具消融实验,表明隐性失败依赖于能力,并且往往是转移而非消失。
博主点评: 本文不仅揭示了多模态搜索系统中潜在的隐性失败,还提供了系统化的分类和评估方法。这为未来的研究提供了重要的参考,尤其是在提高模型的可靠性和准确性方面。