摘要
多模态科学声明验证(MSCV)要求模型使用来自论文的视觉证据(如图形、表格、图表和文本上下文)来验证科学声明。然而,现有方法往往失败,因为它们难以定位决定性的视觉证据,准确读取结构化科学视觉信息,并将多模态观察整合为可靠的推理。
我们介绍了ToolSciVer,这是我们所知的第一个增强工具的MSCV框架。ToolSciVer为视觉语言模型(VLM)配备了三种类型感知的视觉工具:表格行/列聚焦、图表结构解析和高分辨率区域缩放,这些工具将密集的科学视觉信息转化为明确的、面向声明的证据。
该框架通过群体相对策略优化(GRPO)训练策略,复合奖励包括答案正确性、格式有效性、长度控制、工具使用效率和工具有效性惩罚。
我们在SciVer和MuSciClaims数据集上对来自三种模型系列(Qwen、InternVL、Gemma)的五个VLM进行了实验,结果表明我们的方法在性能上优于四个竞争基线,包括基于提示和基于强化学习的工具使用方法,突显了学习的、类型感知的工具使用在科学声明验证中的有效性。
博主点评: ToolSciVer通过引入类型感知的视觉工具,成功提升了科学声明验证的准确性。这种方法不仅解决了传统方法在处理多模态数据时的不足,还为未来的科学研究提供了新的思路,值得关注和深入探讨。