NeFut Logo NeFut
EN 管理员登录

[AI学术] 多模态大型语言模型在科学可视化素养评估中的基准测试

发布于:2026-07-18 22:00 最后更新:2026-07-22 01:24
#AI #Machine Learning #Open Source

摘要

多模态大型语言模型(MLLMs)在解释可视化方面的应用日益广泛,然而当前的评估主要集中于图表,缺乏对科学可视化(SciVis)理解的充分证据。本研究对六种 MLLMs 进行了基准测试,评估它们在科学可视化素养评估测试中的表现,该测试包含 49 个项目,基于 18 种科学可视化和插图,涵盖 8 种技术和 11 种任务类型。

我们在封闭世界协议下评估了三种闭源模型和三种开源模型,并使用 485 名人类参与者的数据进行比较。结果显示,当前的 MLLMs 在 SciVis 素养方面并不均匀。Gemini 模型整体表现最佳,超过了评估子集的平均人类水平,而开源模型的表现则低于人类基线。不同技术和任务的表现差异显著:模型在科学插图、搜索和空间理解上表现较好,但在基于纹理和集成的可视化以及定量估计上则面临困难。

错误分析揭示了在细粒度定量估计、流向解释和基于上下文的编码解释等方面的反复失败。这些发现将 SciVis 素养定位为评估多模态 AI 系统的必要基准维度。我们的代码和模型输出已公开,访问链接:GitHub.

博主点评: 该研究揭示了多模态大型语言模型在科学可视化领域的局限性,尤其是在定量分析和复杂视觉信息的理解上。这为未来的模型改进提供了重要方向,强调了科学可视化素养作为评估标准的必要性。开源模型的不足也提示了进一步研究和开发的需求。

原文链接: https://arxiv.org/abs/2607.15176

[h] 返回首页