摘要
最近,大型语言模型(LLMs)的进步使得代理系统能够将自然语言意图转化为可执行的科学可视化(SciVis)任务。尽管取得了快速进展,但目前社区缺乏一个原则性和可重复的基准,以评估这些新兴的SciVis代理在现实的多步骤分析环境中的表现。我们提出了SciVisAgentBench,这是一个全面且可扩展的基准,用于评估科学数据分析和可视化代理。
我们的基准建立在一个结构化的分类法上,涵盖四个维度:应用领域、数据类型、复杂性水平和可视化操作。目前,它包含了108个专家精心制作的案例,涵盖多样的SciVis场景。为了实现可靠评估,我们引入了一种以结果为中心的多模态评估管道,结合了基于LLM的评判与确定性评估器,包括基于图像的指标、代码检查器、基于规则的验证器和特定案例的评估器。
我们还与12位SciVis专家进行有效性研究,以检查人类与LLM评判者之间的一致性。通过这一框架,我们评估了代表性的SciVis代理和通用编码代理,以建立初始基准并揭示能力差距。SciVisAgentBench设计为一个活的基准,支持系统比较、诊断失败模式,并推动代理SciVis的进展。该基准可在 SciVisAgentBench 获取。
博主点评: SciVisAgentBench的推出为科学可视化领域提供了一个重要的评估工具,能够促进不同代理的系统比较。这种基准的多模态评估方法不仅提高了评判的可靠性,也为未来的研究指明了方向。希望这一工具能够推动科学数据分析的进一步发展。