论文
AgentForge:基于执行的多代理 LLM 自主软件工程框架
AgentForge: Execution-Grounded Multi-Agent LLM Framework for Autonomous Software Engineering
摘要
大语言模型 生成看似合理的代码,但无法验证正确性。现有的多代理系统模拟执行或保留验证可选。我们引入基于执行的验证作为首要原则:每个代码更改都必须在传播之前在沙盒执行中幸存下来。我们在 AGENTFORGE 中实例化了这一原则,这是一个多代理框架,其中规划器、编码器、测试器、调试器和评论器代理通过共享内存和强制性 Docker 沙箱进行协调。我们使用 LLM 将软件工程形式化为存储库状态的迭代决策过程,其中执行反馈提供了比下一个词元可能性更强的监督信号。 AGENTFORGE 在 SWE-BENCH Lite 上实现了 40.0% 的分辨率,比单代理基线高出 26--28 个点。消融证实执行反馈和角色分解各自独立地驱动绩效。该框架是开源的,位于 https://github.com/raja21068/AutoCodeAI。