聚合物性质预测长期缺乏开放、标准化的基准,导致不同机器学习方法难以公平比较,现有资源仅覆盖同质聚合物等有限结构。为此我们推出 PolyBench26,一个包含约 250,000 条聚合物‑性质数据点的公开数据集,覆盖八类物理性质,数据来源包括实验测量、密度泛函理论(DFT)和分子动力学(MD)。
基准设计了四类评估任务,分别针对同质聚合物、交替共聚物、随机共聚物和嵌段共聚物:
- 同分布(in‑distribution)性质预测;
- 数据集规模随训练样本数的伸缩性;
- 重复单元复杂度的影响;
- 对未见聚合物结构的迁移学习。
我们对比了三类模型:语言模型、基于图的模型以及基于描述符的模型。实验表明,基于图的模型在所有任务中误差最小,且在不同训练集规模下保持优势,对重复单元复杂度的提升也表现出更强的鲁棒性。
PolyBench26 为日益复杂的聚合物设计空间提供了可复现的基准平台,代码与数据已在 GitHub 开源:https://github.com/rlearsch/PolymerBenchmark2026。
点评