科学编码代理会生成相互依赖的代码、结果、图形和论断,但仅评估最终输出不足以判断结论是否得到科学支持。我们提出基于证据的多模态科学分析要求代理提供可执行的分析过程,并且其论断必须由同一次运行得到的结果和可视化直接支撑。为此我们构建了 SciRIGOR 框架和基准,收录了来自六大领域、十七个子领域的 100 例论文案例。框架会重建带类型的证据图,将制品的忠实度(artifact fidelity)与关系的有效性(relational validity)分离,并对完整的论断‑支持路径进行评分,同时定位最早出现的无支持关系。基于来源的替代路径容许在科学上等价的分析和可视化。我们在 11 种代理/模型配置上进行评测。全基准运行中,论断与忠实结果和不忠实结果的吻合率几乎相同,分别为 91.8% 与 91.0%。然而没有系统在软证据链得分上超过 62.6%,在严格的全链成功率上超过 18.0%。这些结果表明,仅内部一致性不足以保证科学正确性,必须沿完整的数据‑到‑论断路径验证支持关系。
点评