摘要
多模态大语言模型(MLLMs)在生成图像标题时常常引入错误,导致图像与文本之间的错配。我们的研究聚焦于一种称为系统性错配的标题错误,这种错误在MLLM生成的标题中与特定视觉特征的存在密切相关。
研究目标
鉴于带有MLLM生成标题的视觉语言数据集,我们的目标是检测此类错误,称之为系统性错配检测。
主要贡献
- Symbal:我们提出了一种结构化的双阶段设置,利用现成的基础模型识别系统性错配并用自然语言总结结果。
- SymbalBench:我们设计了一个基准,旨在评估针对我们提出的任务的自动化方法。SymbalBench包含来自两个领域(自然和医学图像)的170万对图像-文本,组织成420个带注释的视觉语言数据集。
性能评估
Symbal在该基准上的表现强劲,正确识别63.8%的数据集中的系统性错配,几乎是最接近基线的4倍。我们还进行了现实世界评估,表明:
- Symbal能够准确识别由四个MLLM生成的标题中的系统性错配。
- Symbal是审计现成图像-标题数据集的强大工具。
最终,我们的新任务、方法和基准可以帮助用户审计MLLM生成的标题并识别关键错误,而无需访问底层的MLLM。代码可在 GitHub 获取。
博主点评: 通过引入Symbal和SymbalBench,研究者们为系统性错配的检测提供了有效的解决方案,这不仅提升了图像与文本的对齐质量,也为多模态学习领域的审计工作提供了新的思路。对视觉特征的深入分析将推动模型生成内容的准确性,具有广泛的应用前景。