RECLAIM 是一个面向机器学习论文复现的基准,收录了 100 篇 NeurIPS 2025 论文,并计划每年从新会议中更新。对每篇论文,事先确定要复现的具体结果、成功的判定标准以及 GPU 小时预算。智能体必须仅凭论文文本和作者公开的资源完成复现,作者提供的资源决定难度层级。
- Run‑tier:提供代码、数据和预训练权重;
- Retrain‑tier:缺少权重,智能体需自行训练模型;
- Reimplement‑tier:缺少代码,智能体需自行实现算法。
评估采用独立的语言模型,根据运行日志和输出自动打分,而非依赖智能体的报告。我们让四个不同的智能体分别在每篇论文上运行一次。结果显示,最佳智能体在 Run‑tier 论文中仅复现成功 41%,在 Retrain‑tier 为 27%,在 Reimplement‑tier 为 15%,且所有层级中最差的智能体表现相同。失败的尝试平均只消耗了 29% 的预算,大多数在预算用尽前就停止。最常见的错误是智能体在实现方法时完全未对照论文中的数值进行检查,出现于 400 次运行中的 63 次。
点评:RECLAIM 揭示了当前 AI 代理在完整科研工作流中的局限性,尤其是在缺少关键资源时的实现与训练能力仍有显著提升空间。