摘要
编码代理可以修复失败的示例,而不保留导致其失败的领域规则,因此后续生成可能会重复同样的合理错误。我们提出了一种针对反例补充草图的代理合成方法,适用于在实现过程中发现其治理政策的系统。人类从一个部分的、代码形状的草图开始,编码代理生成第一个实现。当一个具体的失败暴露出缺失或错误的政策时,操作员明确批准修正后的行为和规则。代理随后修订草图,并修复或重新生成针对该一个反例的代码和提示表面。
完整的存档保留了来源;一个选定的回归集在下一个候选出现之前对每次修订进行把关;定期的清理再生测试确定演变后的草图是否携带了学习到的政策,而不是提示历史或累积示例。我们用 CatSynth,一个合成浏览器应用程序和捕获的编码代理实验来演示该方法。在一次与 GPT-5.4-mini 的开放世界运行中,14 个冻结候选案例中有 8 个成为反例。重建控制继承了该推广计划,所有三条路径都通过了 8 个被接受的案例。从演变后的草图重建通过了 21 个隐含案例中的 19 个,而从初始草图重建并重播所有被接受的示例只通过了 15 个。保留代码跨越反例需要 9 次开发者调用和 719 行累积工件变动,而重播所有则需要 15 次调用和 2394 行,且通过了 21 个隐含案例中的 18 个。这些结果提供了可检查的证据,表明演变后的草图携带了经过审查的政策,并且在此运行中保留代码减少了重工;在一个模型和一个揭示顺序下,它们并未确立超越编码检查的普遍优越性或正确性。
博主点评: 本文提出的代理合成方法在实际应用中展现了其高效性,通过动态修复反例并持续优化代码,展示了在复杂系统治理中的潜力。这种方法不仅提高了代码的稳定性,也为未来的智能编程提供了新的思路,值得关注与深入研究。