NeFut Logo NeFut
EN 管理员登录

[AI学术] 自我提升的AI编程代理:基于行为规则的闭环框架

发布于:2026-07-17 22:00 最后更新:2026-07-18 08:19
#AI #Machine Learning #Open Source

在当前的LLM(大规模语言模型)基础的编程代理中,由于缺乏保留人类审查反馈的机制,代理在多个会话中常常重复相同类型的错误。为此,我们提出了一种闭环框架,将每个被接受的审查评论编码为持久的行为规则,从而逐步扩展代理能够自我检测的错误类别。该框架结合了一个版本控制的指令文件中的累积规则集、在代码提交前执行的自我审查清单,以及确保规则集完整性的自动验证机制。

在一个拥有35个以上服务的微服务平台上进行部署时,规则集从5条扩展到18条行为规则、15个以上语言特定标准,以及一个包含15项内容的自我审查清单,这些都是基于真实的审查反馈得出的。我们展示了来自11次录制工作会话的实证结果,这些会话涵盖了代码生成、PR审查、事件调查和跨服务重构。我们观察到,累积规则将审查工作重心从低层次的正确性转向设计层面的验证,并且实现了被规则禁止的错误类别的0%复发率,这些规则也能够在异构代理接口之间传递。

我们将我们的方案与相关的经验性LLM学习(如Reflexion、ExpeL、Voyager)和自动代码审查(如CodeReviewer、SWE-bench代理)进行比较,结果显示我们的框架在不进行权重更新的情况下实现了持久的跨会话学习,且能够在生产代码库上运作,而非合成基准,解决了现有基准未衡量的一个正交维度(时间上的行为一致性)。最终,构建出一种随着每次审查周期而不断提升的编码代理,积累人类协作者的工程智慧,而无需改变任何模型的权重。

博主点评: 该框架通过将人类审查反馈转化为持久的行为规则,成功解决了LLM编程代理在多次使用中常见的错误复发问题,展示了自我改进的潜力。这种方法不仅提升了代码质量,还为未来的编程代理设定了新的标准,强调了人机协作的重要性。通过不改变模型权重的方式,代理能够在真实环境中持续学习,从而实现工程智慧的积累。

原文链接: https://arxiv.org/abs/2607.13091

[h] 返回首页