现代的全新蛋白结合体设计流程能够产生大量候选分子,但实验验证的资源有限,使得从海量候选中挑选出少数高质量分子成为关键瓶颈。本文探讨了大语言模型(LLM)能否依据预先计算的结构置信度和界面质量代理分数,生成多指标排序策略,以实现后生成阶段的筛选。我们并未提出新的设计流水线,而是聚焦于已有结合体池的后处理:使用一套共享的代理分数,对候选进行统一排序并挑选前 K 名。
在 10 个目标的留出集上,采用五次抽样的全局迭代 gpt-4o 策略,平均 Recall@10 达到 0.589,略高于单特征固定基线 Protenix binder ipTM(Recall@10 = 0.571)。在包含 Nipah、RBX1、TREM2 三个目标的子集上,目标条件化的迭代 gpt-5.4 策略取得最优表现,Recall@10 为 0.519,NDCG@10 为 0.583。
这些实验表明,LLM 生成的排序策略可以作为一种可解释的后生成决策层,将异构的代理指标进行有效组合,从而在大规模候选库中优先排序出潜在的高质量结合体。
博主点评:本文展示了 LLM 在蛋白设计后处理环节的实用价值,尤其是通过自然语言指令灵活组合多种评分指标,为实验筛选提供了可解释且可扩展的辅助工具。