CompMat-Bench 是面向计算材料科学的 AI 代理评估基准,收录 94 项来源于最新材料计算论文的任务。每项任务对应研究工作流中的一步,要求代理准备高成本模拟的输入并解析输出。我们提前复现所有模拟,得到输入/结果作为真值,评估时无需再次运行昂贵计算,且采用固定规则评分,避免使用 LLM 判官。
基准提供四种评估情景:单任务与由相关任务组成的工作流;每种情景又分为完整方法指导和简化指导两种模式。完整指导下,基于三种主流 LLM 的代理在 94 项任务上的通过率为 66.0%–90.4%。当工作流变长或指导信息被削减时,代理表现下降,但下降模式不同:弱势代理在两种情况下均受影响,最强代理仅在“长工作流+简化指导”组合下出现显著下降。
错误分析显示,大多数失败源于科学层面的错误(如误解材料属性、选择不恰当的计算参数),而非软件使用错误。CompMat-Bench 为真实材料研究步骤提供统一比较平台,并帮助揭示 AI 代理的失效模式。
点评