NeFut Logo NeFut
EN 管理员登录

[AI学术] CARAT:材料大语言模型是推理还是背诵?

发布于:2026-10-01 22:00 最后更新:2026-10-06 12:11
#AI #Machine Learning #LLM

CARAT 通过固定问题和金标准答案,在八种匹配视图下进行评估,并在 GraphSpace 中为每个结构关系单独命名。它引入了匹配微调、答案掩码、证据注入、配对推理以及可选择性屏蔽声明的规则。

在最难的家族上,使用基于结构的视图比仅使用公式输入提升了 17.3 分。进一步分析发现,GraphSpace 相比普通周期图提升了 19.3 分,但这其实包含了两种效应:当普通渲染已经包含问题所需全部信息时,仅提升 1.96 分;而当它完全缺失这些字段时,提升高达 46.7 分。换句话说,标题所展示的提升主要反映了基线缺失的内容,而不是证据呈现方式的优劣。

我们还对自己的基准进行了攻击性测试。一个直接跳过链接、读取列表的规则能够直接回答 7 个强化家族中的 4 个,为此我们不断重构规则,直至出现 11 种几乎随机的捷径。冻结的模型虽然会引用链接,但在我们将其重定向后,仍在 95.6% 的配对案例中给出相同答案:它重复了关系而未真正使用。经过匹配监督后准确率升至 99.8%,而删除链接后跌至 23.4%,低于最佳捷径的 27.0%。这表明上述两步均可通过学习实现。

点评

原文链接: https://arxiv.org/abs/2609.38340

[h] 返回首页