NeFut Logo NeFut
EN 管理员登录

[AI学术] BenchBench-Protocol:评估真实实验室协议推理与修改

发布于:2026-08-26 22:00 最后更新:2026-08-29 12:04
#AI #Machine Learning #LLM

我们介绍 BenchBench-Protocol,这是一个针对大型语言模型的基准,包含 149 条实验室协议修改任务,来源于科学家在真实实验中对已发表协议的改动。将已发表的协议适配到新实验是湿实验室科学家的日常工作,正确的修改需要考虑先前的选择和后续步骤。近期的生命科学基准转向开放式、基于评分表的任务,但这些任务通常由专家直接设计,而非从真实修改中重建。BenchBench-Protocol 的任务来源于已发表协议与科学家修改版之间的差异,这为查询提供了依据,也为正确答案的加权评分表提供了依据。基准覆盖 96 份来源协议,涉及九个湿实验生物学领域,仅保留经领域专家高度评价的任务。我们评估了九个闭源和开源模型,Claude Opus 5 在归一化评分表上最高,得分 59.2%,其他模型在 34.1%~47.1% 之间,即使取十次尝试的最佳结果,基准仍未饱和。随着模型在生命科学研究中的帮助日益增多,对其在日常湿实验任务上的评估变得尤为重要。BenchBench-Protocol 提供了对湿实验推理的扎实评估,并展示了利用真实实验构建基准任务的价值。

博主点评:该基准通过真实实验改动构建任务,提升了评估的真实性和挑战性,对推动 LLM 在实验室中的实用化具有重要意义。

原文链接: https://arxiv.org/abs/2608.23898

[h] 返回首页