Activity‑cliff 排序一直很难,因为局部结构的微小变化可能导致活性出现巨大差异,而能够解释这些机制的高质量数据又十分稀缺。为更有效利用已有的活性标签,CliffRank 将绝对活性回归与排序一致性学习相结合。模型同时训练两个并行预测器,损失函数包括均方误差、阈值化的列表式损失以及 Pairwise Preference Consistency(PPC),后者在偏好概率空间对齐相对排序。
在三个抗菌肽数据集上,使用 ESM2‑t12 的 CliffRank 获得了最高的平均 Spearman 相关系数 0.5393 和平均 Recall@50 为 21.4,尽管在单个数据集上领先方法有所不同。
在三个小分子数据集上,CliffRank 与 PNA 结合,并在第 120 轮后激活 PPC,取得了最高的平均 Spearman 相关系数 0.6890,平均 Recall@50 为 30.4,后者与 ACANet‑PNA 持平。PPC 的实验结果也揭示了其实际的局限性。
不对称初始化提升了 MolCLR‑GIN 的整体平均表现,但并未在所有目标上都有提升。对于未使用预训练权重的 PNA,延迟使用 PPC 能改善部分指标,但没有一种调度方案能够同时在平均 Spearman 相关系数和平均 Recall@50 上达到最佳。
未来的工作应当评估更多的目标和抗菌肽体系,研发自适应的 PPC 调度策略,并在可能的情况下加入蛋白质或膜的上下文信息。
点评