自主研究代理需要检索文献、分析实验证据并生成假设,这要求多步骤、基于证据的推理,即在得出结论前逐步获取、整合并验证证据。现有多模态基准大多只评估最终答案的准确率,无法判断预测是否有可追溯的科学证据。为此我们构建了 Sci‑MMR,基于结构化论证图,将科学主张、引用支撑的知识、视觉证据及其对应区域关联起来。数据集包含 235 条跨四个学科的多跳推理任务,每题平均涉及 9 张图像面板。我们对八种前沿多模态模型进行评估,发现答案准确率始终比完整证据恢复率高出 20% 以上,说明仅靠答案评估会显著高估模型的证据推理能力。
进一步的受控实验揭示了两大瓶颈:证据获取——模型难以从科学图形中提取完整结构化证据,占失败的 57.2%;使用裁剪工具仅提升 4.5 分,而提供金标准证据可提升至 37.0 分,表明组装多区域证据仍是难点。证据整合——模型难以将已有证据转化为正确结论,占失败的 31.8%;即使使用金标准证据,最强模型在最难任务上的准确率也仅为 69.1%。这些结果表明,当前以答案为中心的基准严重高估了多模态研究代理的证据驱动推理能力。点评