近期 AI 的快速发展正帮助科学家在数学、医学和材料科学等领域取得突破。为了推动 AI 的进一步进步,研究者们不断构建新的评估数据集。然而,现有的 STEM 数据集仍存在若干不足:模型在这些数据集上已趋于饱和,缺乏进一步评估的空间;分类标签分布不均衡;多数采用选择题形式,与科学家在实际工作中使用 AI 的方式不匹配;以及因竞赛式收集和时间限制的审查导致答案和解释不够准确。为了解决这些问题,我们推出了“Expert‑validated STEM QA”,一个由 241 位领域专家共同构建的高质量数据集,涵盖物理、化学、生物和数学四大方向,共计 398 条问答。我们在数据集构建过程中采取了四项关键措施:① 设计了平衡的分类体系,确保各类目分布均匀;② 对题目贡献者实施基于质量的激励机制,以提升贡献质量;③ 进行多轮审查,并在每轮中依据专家共识对问题和答案进行修订;④ 采用可验证的问答格式,确保每条记录的答案和推理过程均可追溯。实验结果表明,当前主流前沿模型在该数据集上的表现仍然较低,凸显了其评估价值。
点评:该数据集通过严格的专家审校和均衡的 taxonomy,填补了现有 STEM 评估资源的空白,为后续 AI 在科学研究中的应用提供了更具挑战性和真实性的基准。