论文

BackendForge:使用后端服务对代理端到端代码生成进行基准测试

BackendForge: Benchmarking Agentic End-to-End Code Generation with Backend Services

智能体系统Agent任务评测

摘要

大语言模型 (LLM) 越来越多地用于代理编码设置,它们可以在其中检查文件、执行命令、运行测试、观察故障并迭代修改代码。这种转变提出了一个核心评估问题:代理 LLM 能否生成一个在执行时可部署且行为正确的端到端软件工件?后端服务为此评估提供了受控但现实的基础。它们的 API 公开了应用程序级可执行语义,并且可以通过黑盒 HTTP 交互根据 OpenAPI 合约确定性地检查部署的行为。我们引入了 BackendForge,这是一个由 56 个合约定义的后端生成任务组成的基准,由真实的开源应用程序重写。给定可见的规范和 OpenAPI 合约,LLM 必须生成仅通过 HTTP 测试构建、部署和评估的 Docker 化服务。为了在不引入隐藏需求的情况下加强评估,BackendForge 使用测试代理和代码代理来共同演化测试预言机和参考服务,其中测试代理提出基于规范的后端测试,代码代理修复参考实现。尽管性能最佳的模型 GPT-5.5 在基础预言机下成功完成了 55.4% 的任务,但在最终预言机下仅成功完成了 28.6% 的任务。这一差距表明当前的 LLM 可以实现许多本地 API 行为,但仍难以生成完整的后端服务。