NeFut Logo NeFut
EN 管理员登录

[AI学术] OpenDiscoveryTrace:用于评估 AI 科学家工作流的过程追踪数据集

发布于:2026-09-11 22:00 最后更新:2026-09-12 06:35
#AI #LLM #Open Source

现有的自主 AI 科学家基准只评估最终产出——代码、假设或论文——忽略了产生这些产出的推理过程,导致无法审计方法、诊断失效或区分系统推理与偶然猜测。为此我们推出 OpenDiscoveryTrace,一个公开数据集,收录 558 条完整的 AI 科学代理轨迹,记录模型的思考、工具调用、观察、错误、修正触发和自报告置信度等 9 项结构化信息。任务覆盖药物发现、材料科学、基因组学和文献分析,共 124 项科学任务。数据集包含七种模型:三种前沿模型(GPT‑5.4、Claude Opus 4.6、Gemini 3.1 Pro)各 124 条轨迹,保持领域和难度平衡;四种开源权重模型(Qwen2.5‑7B、Mistral‑7B‑v0.3、Phi‑3.5‑mini、Qwen2.5‑1.5B)各 30 条;另有 60 条实时检索变体轨迹。对 363 条经 LLM 判定的轨迹进行初步分析发现,过程追踪揭示了输出评估看不见的行为差异:三种前沿模型的成功率相近(84‑89%),但 Claude Opus 4.6 的错误数是 GPT‑5.4 的 30 倍(每条轨迹 2.5 vs 0.08,$p < 0.01$)。

点评:过程追踪为评估 AI 科学家提供了更细粒度的视角,有助于发现隐藏的错误模式和提升模型可解释性。

原文链接: https://arxiv.org/abs/2609.09203

[h] 返回首页