摘要
智能体基准通常在所有任务完成后比较两个智能体,但高昂的评估成本使得部分运行变得诱人。单靠任务比例无法显示部分运行是否支持与完成基准相同的成对结论。我们通过重放来自 SWE-bench、AppWorld 和 tau-bench 的已完成公共任务记录来研究这个问题。
研究结果
部分预算只有在支持完成基准的决策、涵盖所需任务组,并且未解决的比较不超过目标比例时,才算足够。所需任务比例变化显著。在 5 个百分点预算网格的严格 0 百分点阈值下,AppWorld 首次在 15% 时满足所有目标,tau-bench 在 25% 时满足,SWE-bench Verified 在 90% 时满足;而 SWE-bench Lite 在主要覆盖规则下在 95% 时未满足所有目标。
评估报告建议
部分评估报告应说明一个智能体必须超越另一个智能体的程度、任务选择方式、所需覆盖规则、所使用的决策规则以及可能未解决的比较数量。
博主点评: 本文通过重放分析探讨了智能体基准的有效性,强调了在部分任务执行情况下如何确保评估结果的可靠性。研究结果为智能体性能评估提供了重要的指导,尤其是在资源有限的情况下。建议在进行部分评估时,明确任务选择和决策规则,以提高结果的有效性和透明度。