蛋白质功能由其结构决定,而结构由氨基酸序列决定。传统的蛋白质设计往往先确定目标结构,再让机器学习模型生成可能折叠成该结构的序列。自然界中,同一结构可以由许多不同序列实现,单一序列在不同条件下也可能折叠成多种构象。因此,AI 在设计新蛋白时必须认识到答案并非唯一,而是存在大量可行序列。
Amy E. Keating 等人在《PNAS》发表的工作指出,以“模型能否复现进化选中的序列”作为成功标准并不理想。为此,他们在生物系开发了 PottsMPNN——一种结合了蛋白质结构与稳定性物理原理的机器学习框架。该模型更好地捕捉序列‑能量景观,即每个氨基酸身份与蛋白稳定性之间的关系,从而提升序列生成质量并能预测突变对稳定性的影响。将其加入设计流水线后,研究者能够生成结构上可行、但序列上与任何天然蛋白都不相似的全新蛋白。
Birnbaum 等人强调,噪声(在训练时对结构加入变异)可以降低模型对天然序列的模仿倾向,提升生成序列的多样性。PottsMPNN 采用配对分布来捕获氨基酸之间的相互作用,能够在任意位置对所有 20 种氨基酸的组合进行物理建模,这是其在序列‑能量景观建模上优于其他方法的关键。训练时还加入了进化相关序列,使模型学会不同序列可折叠成相同结构。虽然这仍然依赖于进化信息,但实验表明,随着对天然序列依赖的降低,模型在结构兼容性和能量预测方面表现更佳,甚至对全新蛋白也有效。
在 AI 时代,能够随意设计蛋白将极大拓展生物工程的可能性。Birnbaum 对未来持乐观态度,期待通过针对特定任务的微调进一步提升模型对突变后果的预测能力。Keating 认为,这些方法正推动我们向设计全新、实用的非天然蛋白迈进,为后续突破奠定更坚实的基础。
点评