企业实践者通常将智能体排行榜视为智能体能力的排名。然而,我们通过对三个开源智能体跟踪基准(TheAgentCompany,$\tau^2$-bench和AppWorld)的研究发现,智能体的主要效应在每个数据集和检查类型中占总方差的不到3%,而智能体与任务的交互效应占7-23%。这意味着排行榜实际上是排名专门化,而不是能力。 我们通过四个方面的通用性理论方差分解得出这一结论,使用三个估计器(Henderson Method-I,REML via lme4和Bayesian binomial GLMM)进行拟合,结果在三位小数点处达成一致。四个进一步的发现阐明了排行榜隐藏的内容。 首先,聚合的可靠性在最难的任务四分位数上崩溃:$E\rho^2$在$\tau^2$行动检查中从0.752下降到0.000。 第二,训练单元的可靠性与保留的可靠性负相关($r = -0.90$在$\tau^2$上),这意味着看起来最可靠的设计在复制时表现最差。 第三,人口层面的诊断可以跨企业基准转移(能力差距比率稳定在0.35-0.40),但每个家族的智能体排名会反转。 第四,在MAST故障分类法中,跟踪级别的模式配置文件是特有的(MAE = 0.261),而单元级别的配置文件是通用的(MAE = 0.056,$r = 0.83$)。 我们将这些内容打包成部署决策可靠性(DDR),一种一页的报告纪律,将方差分量表转化为企业购买者可以辩护的五个决策。 所有代码、数据加载器和拟合工件都在开源许可下发布。 博主点评: 本文通过对智能体跟踪基准的研究,揭示了排行榜的局限性和可靠性的重要性,为企业购买者提供了一个决策框架。