NeFut Logo NeFut
EN 管理员登录

[AI学术] 分子既视感:前沿语言模型的数值检索

发布于:2026-09-08 22:00 最后更新:2026-09-09 09:08
#AI #Machine Learning #LLM

大型语言模型(LLM)在分子属性基准上被广泛评估,但准确率无法区分模型是预测属性还是直接检索已发表的数值。我们对22个前沿模型在12个回归基准上进行逐字检索审计,发现检索现象普遍但高度依赖基准:在5个数据集上超过 $50\%$ 的模型出现逐字检索,其余数据集仅在少数单元格出现。实验在两种推理层级进行,结果显示推理层级影响检索率,同一分子、相同提示在更高推理层级下的检索标记率比最低层级高出 $89\%$。随后我们在最受污染的案例中尝试中断检索,发现即使在最强模型中仍能识别经过变换的 SMILES 字符串与原始标签的组合。抑制检索后,各模型的相对预测误差趋于一致,而逐字检索的差异则使误差分散。这表明 LLM 的整体预测能力并非仅由记忆的数值量决定。本文提供了前沿 LLM 在分子回归基准中逐字检索的数量与深度概览。

点评

原文链接: https://arxiv.org/abs/2609.05381

[h] 返回首页