在AI模型快速进步的背景下,自动编码能力不断提升,尤其是AI实现C编译器等单次演示显示了这一趋势。然而,现有的编码基准通常聚焦于短期任务,且这些演示往往受到人类指导,缺乏系统性比较。
为了解决这些问题,我们引入了MirrorCode,这是一种基于重实现完整软件项目的长期编码基准。在MirrorCode中,AI代理必须在不访问源代码的情况下,复制现有程序的功能。AI解决方案必须在端到端测试中,与原程序的输出完全匹配,包括保留测试。
MirrorCode涵盖了25个目标程序,涉及Unix工具、数据序列化与查询工具、生物信息学、解释器、静态分析、密码学和压缩等多个计算领域。现有的AI模型已经能够重新实现复杂软件,其中最强模型在基准测试中得分为56%。例如,AI可以重新实现gotree,一个包含16,000行代码的生物信息学工具包,而我们认为这一任务对人类工程师来说需要数周时间。
然而,研究性能前沿需要比典型基准更大的推理预算,例如,对大型任务的单次尝试费用为2,600美元,耗时19天。我们的研究表明,AI代理已经能够完成长期的软件工程任务,尤其是在需求被精确指定时。
更广泛地说,我们的工作暗示了AI将在软件工程领域产生变革性影响,随着自主代理的不断进步。
博主点评:MirrorCode的提出标志着AI在软件开发领域的一个重要里程碑,它不仅展示了AI在复杂任务中的潜力,也凸显了未来软件工程的自动化趋势。随着AI技术的不断演进,开发者可能会更多地转向利用这些工具来提高效率。