大型语言模型正被用于 AI 驱动的材料协同科研中,然而其验证流程的可靠性仍未明朗。金属有机框架(MOF)因结构可能对应多个标识、合成结果高度依赖实验条件、证据分散在异构来源以及部分假设需依赖计算而成为难点。我们构建了一个诊断基准,包含结构定位、合成条件核实、证据充分性检查以及基于机器学习势能(MLIP)的计算验证四类任务。针对 T‑MOF‑1‑3,在闭卷、检索增强和真值证据三种设置下评估,以定位知识获取、证据收集和推理的失效环节;T‑MOF‑4 则专注计算验证。基于这些失效模式,我们设计了 MOF‑Verify——一个在生成最终结论前先处理结构、文献、证据充分性和计算瓶颈的失效感知代理系统。实验表明,在多种骨干大模型上,MOF‑Verify 相比直接推理和检索基线显著提升了假设验证的准确率。基准数据已在 https://github.com/IMMS-Ewha/MOF-Verify-Benchmark 开源。
点评