NeFut Logo NeFut
EN 管理员登录

[AI学术] PFArena:蛋白质改造语言模型基准

发布于:2026-09-25 22:00 最后更新:2026-09-28 00:49
#AI #Machine Learning #LLM

蛋白质改造需要在极其庞大的序列空间中搜索,但实验验证成本高且通量低。近年来,蛋白质语言模型(PLM)、大语言模型(LLM)以及基于 LLM 的智能体在该任务上展现出潜力,却缺乏在真实实验决策场景中的系统对比。为填补这一空白,本文提出 PFArena 基准,包含四种受控任务接口,覆盖单突变生成和多突变排序两大方向。通过提供不同层次的突变适应度数据,PFArena 模拟四类研究情境,分别对应先验实验信息的缺乏或丰富程度。

我们选取六种 PLM、六种 LLM 和五种基于 LLM 的智能体进行评估,使用峰值表现和整体表现两类互补指标量化模型在蛋白质改造中的效果。实验结果显示,模型性能随目标特异性实验证据的可得性呈系统性变化:在开放式单突变生成任务中,PLM 依赖蛋白质特有的先验信息表现突出;而在多突变排序任务,尤其是提供目标适应度数据时,LLM 与智能体的表现更为强劲。尽管如此,所有模型在搜索空间扩大和突变深度增加时均面临显著挑战。

我们已开源代码和基准套件,以促进模型辅助蛋白质改造的可复现研究。点评

原文链接: https://arxiv.org/abs/2609.28921

[h] 返回首页