NeFut Logo NeFut
EN 管理员登录

[AI学术] Messier:跨基准智能体评估的高分辨率语料库

发布于:2026-07-30 22:00 最后更新:2026-07-30 23:39
#AI #Benchmark #Evaluation

摘要

评估智能体在交互环境中的表现受到任务分散、支架、验证者和评分规则的限制。现有的努力集中于狭窄的设置,规模有限或需要昂贵的重跑,导致大量实证记录不可比拟。我们推出了Messier,一个统一的语料库,包含957,253条记录,涵盖30个基准、714个智能体、11,891个任务和74,205个验证者。Messier整合了公共基准分数,并通过在六个代表性不足的专业和科学领域(包括最近的法律基准)中进行五个智能体的运行来补充这些数据。

每条记录都通过模型、支架、环境、任务、验证者和聚合规则进行标准化,并具有SOC/NAICS分类,以便进行职业和行业分析。利用这一语料库,我们展示了前沿进展在基准类型间的不均衡,其中“功能调用”已达到饱和,“编程”进展最快,而“企业工作流程”仍然是最具挑战性的。此外,反事实重新评分显示,在多验证者任务中,严格的全通过聚合可能会掩盖进展并人为改变智能体排名。

从这些标准化的记录中,我们推导出能力规模,这些规模与Epoch的评估能力指数排名的Spearman \rho = 0.81相一致,并可以按领域、职业、动作空间或验证者类型进行专业化。Messier为智能体能力缩放、基准审计和评估失败的细致分析提供了基础性、可重用的基础设施。

博主点评: Messier的推出为评估智能体的能力提供了重要的标准化基础,尤其是在各类任务和环境中。通过提供丰富的记录和分类,它不仅有助于理解智能体的性能,还为未来的研究提供了广泛的可能性。这样的语料库在AI领域的评估中具有深远的影响,能够促进更公平、更有效的比较与分析。

原文链接: https://arxiv.org/abs/2607.25891

[h] 返回首页