在开放世界环境中,图像质量评估(IQA)面临着有限的泛化能力和可解释性。近年来,基于多模态大型语言模型(MLLMs)的方法引入了文本推理来进行质量预测,但其判断严重依赖于语义偏见的内部表示,导致对低级感知退化的敏感性不足。为此,我们提出了IQA-T1,这是一种基于工具的视觉证据推理框架,增强了MLLM推理与显式感知观察的结合。
在推理过程中,该模型能够自主调用专门的分析工具,生成结构化的视觉证据,例如噪声残差图、梯度统计和频谱信息,并将这些信息逐步整合到推理过程中。为支持这一范式,我们构建了Q-Tool数据集,其中包含11k个基于工具生成证据的多模态推理链。
经过在七个IQA基准上的大量实验,IQA-T1在各数据集上均取得了最佳整体性能,同时生成了可解释且基于证据的质量评估。
代码和数据集可在 GitHub 获取。
博主点评: IQA-T1通过引入工具生成的视觉证据,显著提升了图像质量评估的准确性和可解释性。这种方法不仅解决了传统MLLM在低级视觉特征处理上的不足,同时也为未来的多模态推理提供了新的思路,具有重要的实用价值和研究意义。