摘要
多模态大语言模型(MLLMs)能够将可视化模式与外部原因、后果及领域知识相连接,但这些解释的证据基础往往不明确。
我们对来自四个来源的102个可视化图表及三种MLLMs和四种输入条件进行了探索性研究,条件变化包括对图像的访问、特定来源的可访问图表上下文以及被隐去的上下文框架。
在1224个描述中,我们分析了模型归因的直接(DIRECT)、派生(DERIVED)和推测(SPECULATIVE)标签,并进行了数值一致性的自动审核。可访问的图表上下文使得Gemini和GPT倾向于产生DIRECT声明,并且在某些模型中提高了数值一致性。
将图像添加到完整上下文中并未带来一致的数值益处,而被隐去的上下文提示并未可靠地增加谨慎语言。提示定义的现实世界意义部分仍然主要是SPECULATIVE。
这些结果促使我们开发可区分由证据支持的声明与模型供给的解释的可访问描述系统。
博主点评: 本文对多模态大语言模型在可视化生成中的应用进行了深入分析,揭示了模型生成声明的复杂性及其在不同上下文中的表现差异,强调了建立可证实的可视化描述系统的必要性。此研究为未来在可视化领域的模型应用提供了重要的方向和启示。