NeFut Logo NeFut
EN 管理员登录

[AI学术] 超越预测准确性:分子表示的可靠性审计与人类嗅觉的关系

发布于:2026-07-30 22:00 最后更新:2026-07-30 23:39
#AI #Machine Learning #optimization

在分子编码器的评估中,常常仅通过下游预测来衡量其效果,但仅有预测准确性并不能证明所学习的表示捕捉到可重复的科学结构,或超越强基线的信息,或能够在分布外进行迁移。本文对人类嗅觉的分子表示进行了一项可靠性导向的审计,涵盖四个主要方面:全球感知几何、超越化学的增量预测值、跨数据集复制和未见成分的混合转移。

我们使用Keller-Vosshall和Bierling的单分子评分数据集以及Ma的二元混合数据集,比较MoLFormer和ChemBERTa与RDKit描述符和Morgan指纹在身份控制和匹配评估下的表现。基于强度、愉悦度和熟悉度的人类三属性评分几何在参与者分割中是可重复的(中位RSA 0.743和0.855),而模型与人类的对齐则显著较弱(RSA 0.019-0.158)。学习到的嵌入在全球对齐中并未始终优于传统表示,而MoLFormer在单分子数据集中也未能提供超越结合RDKit和Morgan基线的清晰增量预测值。人类几何在63个共享分子上显示出正但不完全的协议(RSA 0.331;95%自助区间[0.204, 0.507])。在一个严格的未见成分混合分割下,增量效果依赖于结果和表示,所有区间均跨越零。

这些结果为评估的通用分子编码器建立了实证边界,并激励了更广泛的评估原则:科学领域中的表示质量应分别评估目标可靠性、结构对齐、增量信息、复制能力和分布外转移。

原文链接: https://arxiv.org/abs/2607.24848

[h] 返回首页