代理评估被用于比较大语言模型并指导部署,但排行榜的排名受模型本身和评估条件(如脚手架或任务)的共同影响。可靠性因此取决于所要支持的结论:能够可靠排序已部署系统的评估,未必能可靠排序底层模型。
为了解哪些结论可信,作者提出一种基于贝叶斯方差分解的框架,专门处理稀疏且不平衡的代理排行榜,并在Holistic Agent Leaderboard和Harbor Index的22个基准上实验。框架把与声明相关的信号(模型真实差异)与噪声(无关变动)分离。
主要发现包括:① 可靠性取决于测量目标。固定模型‑脚手架系统的排名可靠性高(0.935‑0.994),而底层模型的可靠性显著低(0.148‑0.841)。② 脚手架选择会改变结论,跨脚手架可靠性衡量脚手架是否保持模型排序,结果显示不同评估的脚手架效应差异大。③ 增加任务数量并不能消除所有不确定性。当不确定性主要来源于脚手架覆盖不足时,即使无限多相似任务也只能把模型排序可靠性提升至最多0.097。④ 将多样化基准合并可以在相同任务预算下提升跨任务排名可靠性,从0.44提升至0.75,并且成本最高可降低83%。
因此,评估设计应围绕预期结论展开:明确分数或排名的含义,诊断限制可靠性的因素,并将评估预算投入到真正影响不确定性的来源。
点评