摘要
大语言模型(LLM)代理在以正确性为导向的仓库级任务中表现良好,例如 SWE-Bench 问题解决和真实代码库中的特性实现。然而,它们在仓库级代码优化方面仍然面临挑战,这要求在改善运行时性能的同时保持行为一致。在这种情况下,仅通过测试并不足够;补丁必须保持行为,实施代码优化,并接近专家的加速效果。
当前的代理通常难以发现隐藏在抽象层和本地扩展后的瓶颈,往往在浅层加速后停止,或对代码补丁的测试不足,从而可能在边缘情况下静默破坏。为此,我们提出了 PerfAgent,一种基于剖析器的、验证者在环的工作流,能够为现成的编码代理提供必要的反馈,以发现真正的热点,超越初始的通过补丁,并利用剖析器证据而非单纯的时间来决定接下来优化的目标。
在两个具有挑战性的优化基准测试中,GSO 和 SWE-fficiency-Lite,PerfAgent 与 GPT-5.1 的 OpenHands 相比,专家匹配补丁的速度提高了两倍多,在 GSO 上从 19.6% 提升至 39.2%,在 SWE-fficiency-Lite 上从 26% 提升至 74%。它还以显著更低的成本超越了最佳五次基线,显示出收益来自更好的反馈,而非额外的测试时间采样。
博主点评: PerfAgent 的创新之处在于其通过剖析器导向的反馈机制,使得代码优化不仅仅依赖于表面的性能测试,而是深入挖掘实际的性能瓶颈。这一技术能够有效提升代码优化的质量和效率,值得开发者关注和实践。