NeFut Logo NeFut
EN 管理员登录

[AI学术] SciTrue:在 NTCIR SciClaimEval 任务中使用前沿与开源语言模型进行可靠的科学声明验证

发布于:2026-09-03 22:00 最后更新:2026-09-04 02:14
#AI #Machine Learning #LLM

我们介绍了 SciTrue 团队在 NTCIR‑19 SciClaimEval 任务两个子任务中的参赛方案。任务要求系统依据论文的表格和图形验证科学声明。我们没有针对单一模型进行调优,而是采用诚实的逐样本协议,对十一种前沿和开源多模态模型进行基准测试,并结合轻量、透明的后处理。

在官方盲测排行榜上,SciTrue 在四个证据类别/子任务组合中有三项以明显优势夺冠,另一项在主要指标上并列第一。结果可以归结为三点发现。第一,强指令调优模型已经具备竞争力:Claude Opus 4.8 与 Gemma‑4‑31B 的表现均超过最强公开基线 o4‑mini,GPT‑5.5 与 Claude Fable 5 在两个子任务上均领先(Subtask 2 达到 97.7)。第二,任务的配对结构是最大的提升因素:一种“无泄漏配对先验”仅凭声明文本(可见字段)即可恢复 Supported/Refuted 配对,并将 Supported 分配给置信度更高的证据,使 Subtask‑1 的配对准确率从 72.2 提升至 93.5,远超模型替换或集成加权的效果。第三,逐案审计表明剩余错误大多是视觉上不可检测的标签映射错误或数据集标签噪声,导致测得的准确率低估了真实能力,可通过模型改进的空间有限。受控的微调、蒸馏以及代理一致性检查均支持上述结论;我们还记录了一种测量泄漏——标签信息通过数据包装而非内容泄露,例如文件顺序编码了标签,导致一次实例短暂误导了我们的流水线。

点评:本工作展示了在科学声明验证任务中,多模型基准与配对先验的协同效应能够显著提升性能,同时提醒研究者关注数据包装层面的潜在泄漏。

原文链接: https://arxiv.org/abs/2609.00654

[h] 返回首页