NeFut Logo NeFut
EN 管理员登录

[AI学术] Agentic BAIM-LLM 评估(ABLE):LLM 在蛋白质设计工具中的基准测试

发布于:2026-09-10 22:00 最后更新:2026-09-12 06:35
#AI #Machine Learning #LLM

我们提出 ABLE 基准,用于评估大型语言模型(LLM)在双用途蛋白质设计工作流中调用生物 AI 模型(BAIM),如 ProteinMPNN 与 AlphaFold3 的能力。

ABLE 包含结构检索、序列生成和设计验证三个维度的任务集合,旨在衡量模型的信息获取、工具选择与实际使用三个环节的表现。

我们对 15 种前沿模型进行实验,结果显示有 7 种模型拒绝完成全部任务,其余模型在不同任务上表现差异显著。Claude Sonnet 4 与 Gemini 3 Pro 在信息检索、工具选择和工具使用三个子任务上均取得最高分。

进一步,我们将部分任务的模型表现与专家人工基准进行对比,发现当前 LLM 能显著降低蛋白质设计的技术门槛,但在规划步骤、策略生成以及将生物学知识与工具使用相结合方面仍不够稳定。

点评

原文链接: https://arxiv.org/abs/2609.05818

[h] 返回首页