近期 AI 的快速发展正帮助科学家在数学、医学和材料科学等领域取得突破。为了推动这一趋势,研究者们不断构建用于评估 AI 模型的新数据集。然而,在 STEM 领域,主流模型已经消耗了大部分公开的在线数据,这使得亟需由领域专家亲自编写、能够真实反映前沿知识的数据集。现有的 STEM 数据集虽已对社区开放,但仍存在若干不足:
- 模型在这些数据集上的表现已趋于饱和,缺乏进一步区分模型能力的空间;
- 题目分类(taxonomy)分布不均,导致评估偏向某些子领域;
- 多选题形式与科学家在实际工作中使用 AI 的方式不匹配;
- 受限于竞赛式的数据收集和时间紧迫的审阅流程,答案和解释常出现错误。
本文提出了 Expert-validated STEM QA,一个由 241 位领域专家共同打造的高质量 STEM 问答数据集,涵盖物理、化学、生物和数学四大方向,共计 398 条问答。我们在构建过程中采取了以下关键措施:
- 精心设计了平衡的分类体系,确保各子领域题目数量大致相等;
- 对题目贡献者进行严格筛选,并提供基于质量的激励机制;
- 组织多轮审阅,所有修改均需得到专家共识的验证;
- 采用可验证的问答格式,便于后续复现与评估。
实验结果显示,当前主流模型在该数据集上的表现仍然较低,$\text{performance}\approx 30\%$,表明该数据集能够提供有意义的评估空间。
博主点评:该数据集填补了现有 STEM 评估资源的多项空白,尤其在专家验证和分类平衡方面的做法值得借鉴。未来可进一步扩大规模,加入更多交叉学科题目,以提升对通用 AI 能力的全面考察。