NeFut Logo NeFut
EN 管理员登录

[AI学术] TruthInsightBench:基于证据的开放式科学发现代理自动评估基准

发布于:2026-09-08 22:00 最后更新:2026-09-09 09:08
#AI #Machine Learning #LLM

自主编码代理正被设想为能够进行分析并撰写研究报告的 AI 科学家系统,但执行预设分析并不等同于实现发现。现有基准多围绕隐藏的目标研究设计任务、数据和评分标准,恢复其结果即可得分。TruthInsightBench 则专为发现而设。它包含 40 项盲测任务,取自 10 个科学领域的 40 篇同行评议论文,只提供中性科学目标和冻结数据,隐藏原始结论、期望值和分析路径,要求代理自行判断数据支持的主张。评分采用固定的基于 LLM 的评审器,从六个维度评估主张的证据成熟度,细化为 29 项基于产物的指标,采用自动、确定性的聚合方式,无需每例人工打分,因而可随代理迭代重复评估。基于同一冻结基模型的四个编码代理在 100 分制上形成狭窄平台(58.4‑60.3),两两比较无统计显著差异:它们能够熟练执行并记录分析,证据可审计性和新颖性相对较强,但在建立可信主张所需的关键行为——如对照实验、稳健性检验、可证伪性和跨数据集泛化——上表现不足。瓶颈在于科学判断而非编码实现,真正的发现仍未触及。TruthInsightBench 将这一差距量化为可测目标,数据与评分代码已公开于 https://github.com/TruthInsight-stack/TruthInsightBench

点评

原文链接: https://arxiv.org/abs/2609.05079

[h] 返回首页