NeFut Logo NeFut
EN 管理员登录

[AI学术] BioEVAL:面向生物工程的全球多机构大语言模型与多模态模型基准

发布于:2026-09-28 22:00 最后更新:2026-09-30 01:41
#AI #Machine Learning #LLM

BioEVAL(BioEngineering Validation of AI and LLMs)是一个由全球 22 个研究团队共同发起的基准,旨在评估大语言模型在生物工程各子领域的实验推理能力。基准覆盖 11 大子领域以及若干未分类项目,共计 608 条评测项,其中 380 条为选择题(经审计后保留 359 条),218 条为文献综述任务,10 条为包含实验图像的多模态题目。所有题目在作者团队内部完成专家评审,并通过统一的质量控制流程。评测结束后,对最高和最低准确率的选择题进行盲审,发现 21 条需修订或剔除,这些题目被排除在最终统计之外,所有 MCQ 结果均基于 359 条有效题目计算。我们对多种云端基础模型和多模态模型(如 ChatGPT、Gemini、Grok)以及可在消费级 GPU 上本地部署的模型进行了评估。模型在选择题上最高达到 90% 的准确率,文献综述任务的相似度得分最高为 0.72,多模态推理题目中最高准确率为 80%,但不同子领域之间表现差异显著。排行榜展示了当前能力、局限以及后续研发重点。BioEVAL 采用可扩展的标准化协议,支持持续的专家题目贡献和模型评测。

点评

原文链接: https://arxiv.org/abs/2609.30489

[h] 返回首页