NeFut Logo NeFut
EN 管理员登录

[AI学术] ExecuGraph:多智能体执行基础框架,提升后端代码合成的可靠性

发布于:2026-07-24 22:00 最后更新:2026-07-26 07:44
#algorithm #AI #Open Source

摘要

大型语言模型(LLM)可以生成看似合理的后端代码,但单次生成的范式无法保证代码的正确性或运行时的可靠性。为此,我们提出了ExecuGraph,这是一个以执行验证为核心的多智能体框架,用于后端代码合成。

该框架由六个专业智能体(计划者、代码生成器、逻辑审查者、评估者、优化器和解释者)组成,这些智能体通过一个有类型的有向工作流进行协调,并设定了有限的重试预算。ExecuGraph在LangGraph上实现,使用本地托管模型(Ollama)和可选的检索层以回忆算法技术。每次评估都在一个子进程隔离的沙箱中进行,并设定了墙钟超时。

我们在一个策划的30题数据结构与算法(DSA)套件(internal-30)、HumanEval(n=64)和一个APPS入门子集上进行了评估,将ExecuGraph与单智能体一次性基线和单智能体执行重试基线进行对比(一种Reflexion风格的消融实验,隔离多智能体分解的贡献)。

在internal-30上,三种条件的统计差异不显著(n=30;配对Wilcoxon p=0.59 MF vs. SO, p=0.08 SR vs. SO);95%的自助法置信区间在所有成对均值差异中均包含零。在HumanEval上,多全边领先3.1个百分点。最强的信号来自跨模型:使用DeepSeekCoder V2 Lite时,图类别准确率从57.5%(一次性)提升到80.0%(多全),增长22.5个百分点,支持了一个扩展假设:多智能体分解的价值随着基础模型能力的提升而增长。

该框架的主要贡献在于方法论:一个单一的代码库通过配置可以折叠为一次性、执行重试和每个智能体消融条件,使得每个杠杆的边际贡献能够被控制地测量。我们报告了每个智能体的消融、重试预算扫描、错误类别分类法和测试源审核。

博主点评: ExecuGraph通过多智能体协同工作提升了后端代码生成的可靠性,尤其在执行验证的基础上,展示了多智能体分解的显著优势。这种方法不仅优化了生成效果,还为未来的代码合成研究提供了新的思路与框架。

原文链接: https://arxiv.org/abs/2607.20499

[h] 返回首页