NeFut Logo NeFut
EN 管理员登录

[AI学术] 性能优化基准测试是否可靠地衡量编码代理的表现?

发布于:2026-07-19 22:00 最后更新:2026-07-22 01:02
#algorithm #optimization #C++

在这篇研究中,我们对多种代码优化基准测试(如 GSO、SWE-Perf 和 SWE-fficiency)进行审核,这些测试通过对真实代码库应用补丁,并与未优化的基线和官方参考补丁进行运行时比较,来评估编码代理的性能。

尽管这些基准测试的排行榜分数越来越被用作编码代理进步的证据,但这些分数可能会混淆运行时的不稳定性、特定基准测试的评分规则,以及已经被至少一个公共提交解决的任务数量。

首先,我们回放了740个代码优化任务的官方参考补丁,使用四种常见的 Google Cloud 机器。大多数基准任务可以回放,但其参考补丁在每次跨机器回放中仅满足原始基准有效性规则的任务数量分别为 GSO 的 39/102、SWE-Perf 的 11/140 和 SWE-fficiency 的 411/498;SWE-Perf 特别脆弱,因为许多参考补丁几乎没有产生运行时变化。

其次,我们表明公共提交排名强烈依赖于基准评分规则。在 GSO 和 SWE-fficiency 共享的八个公共提交中,官方排名在 28 个成对提交比较中有 9 个存在不一致,而 SWE-fficiency 的排行榜评分规则赋予最差的十个任务过高的分数权重,范围为 58.5%-82.8%。

第三,观察每个任务的 10 个公共提交,我们发现至少有一个提交在 85.3%(384/450)的回放有效 GSO 和 SWE-fficiency 任务中匹配或超过参考补丁,并在 99.8%(449/450)情况下超过未优化的基线代码。

我们的研究通过识别更可靠的性能信号的任务、量化每个任务的分数贡献,并揭示被汇总排名隐藏的剩余性能差距,补充了排行榜分数的意义。

原文链接: https://arxiv.org/abs/2607.01211

[h] 返回首页