摘要
大型语言模型(LLMs)的演变催生了意图驱动的软件开发新范式,期望自主代理能够从零开始设计并交付完整的可运行软件系统。然而,现有基准未能充分评估这一0到1生成能力,主要存在两个根本限制。首先,它们依赖于预定义的结构框架,使得任务简化为仅仅是填充文件。其次,它们依赖于严格的白盒单元测试,迫使生成的代码遵循特定的内部实现,而非验证以用户为中心的端到端行为。
为了解决这一问题,我们引入了CLI-Tool-Bench,这是一种新颖的、结构无关的基准,旨在评估从头开始生成命令行接口(CLI)工具的能力。该基准由一个自动化的黑箱差异测试框架驱动,包含94个高质量的真实世界代码库,涵盖多种编程语言和复杂性等级。对于每个任务,代理被提供一个空工作区,迫使其自主处理代码库规划和依赖关系。
我们通过在隔离的沙箱中执行生成的软件来评估其性能。系统级副作用和终端输出随后使用严格的多层等价度量与人类编写的参考进行比较。对七个最先进的LLM进行的广泛评估显示,顶级模型的最高整体成功率仅为43.8%,这突显了0到1软件生成仍是一个高度挑战的前沿领域。此外,我们发现代理生成单一代码结构的倾向较强,并且更高的令牌消耗并不一定能带来更好的任务表现。
博主点评: 这项研究揭示了当前大型语言模型在自主软件生成方面的局限性,尤其是在CLI工具的生成中。通过引入CLI-Tool-Bench基准,研究者们为评估和提升软件生成能力提供了新的视角,但仍需更多探索以克服现有模型的不足。未来的研究或许可以关注优化生成策略和提高代码结构的多样性。