论文

ExecuGraph:面向可靠后端代码合成的执行落地多智能体框架

ExecuGraph: A Multi-Agent, Execution-Grounded Framework for Reliable Backend Code Synthesis with Large Language Models

智能体系统AI 基础设施Agent 架构与控制循环Agent HarnessSandboxAgent Sandbox

摘要

大语言模型能生成看似合理的后端代码,但单次范式不保证正确性或运行时可靠性。我们提出ExecuGraph,一个把基于执行的验证置于后端代码合成中心的多智能体框架:六个专职智能体(规划者、代码生成器、逻辑评审、评估者、优化者与解释者)由类型化有向工作流协调,带有限重试预算,实现于LangGraph与本地托管模型(Ollama),带可选检索层做算法技术召回;子进程隔离沙箱以墙钟超时守护每次评估。我们在精选30题DSA套件(internal-30)、HumanEval(n=64)与APPS入门子集上评估,把ExecuGraph与单智能体一次生成基线及单智能体执行重试基线(隔离多智能体分解贡献的Reflexion式消融)对比。在internal-30上三种条件统计不可区分(n=30;配对Wilcoxon p=0.59与0.08);所有成对均值差的95%自助置信区间含零。HumanEval上多智能体全配置领先3.1个百分点。最强信号是跨模型的:用DeepSeekCoder V2 Lite时,图类题目准确率从一次生成的57.5%提升到多智能体全配置的80.0%(+22.5分),支持一个扩展假说:多智能体分解的价值随基座模型能力增长。框架的主要贡献是方法论的:单一代码库经配置折叠为一次生成、执行重试与逐智能体消融条件,实现对每个杠杆边际贡献的受控测量。逐智能体消融、重试预算扫描、错误类分类与测试源审计均有报告。