NeFut Logo NeFut
EN 管理员登录

[AI学术] 专家验证的 STEM 问答数据集

发布于:2026-09-01 22:00 最后更新:2026-09-02 01:25
#AI #Machine Learning #Data Structure

近期 AI 的快速发展正帮助科学家在数学、医学和材料科学等领域取得突破。为了推动这一趋势,研究者们不断构建用于评估 AI 模型的新数据集。然而,在 STEM 领域,主流模型已经消耗了大部分公开的在线数据,这使得亟需由领域专家亲自编写、能够真实反映前沿知识的数据集。现有的 STEM 数据集虽已对社区开放,但仍存在若干不足:

  1. 模型在这些数据集上的表现已趋于饱和,缺乏进一步区分模型能力的空间;
  2. 题目分类(taxonomy)分布不均,导致评估偏向某些子领域;
  3. 多选题形式与科学家在实际工作中使用 AI 的方式不匹配;
  4. 受限于竞赛式的数据收集和时间紧迫的审阅流程,答案和解释常出现错误。

本文提出了 Expert-validated STEM QA,一个由 241 位领域专家共同打造的高质量 STEM 问答数据集,涵盖物理、化学、生物和数学四大方向,共计 398 条问答。我们在构建过程中采取了以下关键措施:

实验结果显示,当前主流模型在该数据集上的表现仍然较低,$\text{performance}\approx 30\%$,表明该数据集能够提供有意义的评估空间。

博主点评:该数据集填补了现有 STEM 评估资源的多项空白,尤其在专家验证和分类平衡方面的做法值得借鉴。未来可进一步扩大规模,加入更多交叉学科题目,以提升对通用 AI 能力的全面考察。

原文链接: https://arxiv.org/abs/2608.28591

[h] 返回首页