NeFut Logo NeFut
EN 管理员登录

[AI学术] ICAE-Bench:评估交互式项目构建的编码代理

发布于:2026-07-25 22:00 最后更新:2026-07-26 07:44
#algorithm #C++ #Open Source

摘要

最近,Vibe 编码工作流的出现正在改变编码代理的预期功能。代理不再仅仅是在完全指定的指令下完成代码,而是越来越多地需要将不完整的产品意图转化为可工作的软件,这要求它们结合多种能力,包括规划、需求澄清、工具使用、调试和仓库级构建。

然而,现有的基准测试尚未完全跟上这一变化,它们主要评估代理在静态、完全指定任务下的表现。本文提出了 ICAE-Bench,这是一个用于在交互式项目构建环境下评估编码代理的基准工具。其基本思路是从模糊的产品需求开始,模拟动态范式,使用自动化用户代理。

为了使这一环境既真实又可评估,ICAE-Bench 引入了三个关键设计。首先,为了避免不受约束的模糊需求带来的歧义,每个任务都源于一个具有可执行行为的精确真实开源仓库。其次,为了确保高质量和可重复的用户模拟,ICAE-Bench 通过用户代理数据来支持交互,使用户代理能够揭示隐藏的约束,而不必发明新需求或泄露实现细节。最后,为了公平评估开放式仓库,ICAE-Bench 使用标准化的黑箱测试和多维诊断,包括功能正确性、语义和 API 相似性、结构保真度、设计质量和交互质量。

博主点评: ICAE-Bench 的引入针对现代编码代理的实际需求,尤其是动态项目构建中复杂性与不确定性的问题,标志着评估方法的重大进步。通过精确的开源仓库与高质量用户模拟,它能有效评估代理在真实环境中的表现,推动编码代理的发展。

原文链接: https://arxiv.org/abs/2607.21217

[h] 返回首页