论文

E2E-SWE:从头开始构建工作代码库的大语言模型基准测试

E2E-SWE: Benchmarking LLMs on Building Working Codebases from Scratch

智能体系统Agent任务评测

摘要

由大语言模型 (LLM) 支持的编码Agent正在从进行本地化代码更改发展到开发完整的软件存储库。然而,评估存储库规模的生成仍然具有挑战性:任务必须要求系统级推理,同时确保所有评估的行为都得到精确指定并且独立于任何特定实现。我们引入了 E2E-SWE,这是一个评估编码Agent是否可以端到端构建完整的功能性软件存储库的基准。 E2E-SWE 包含 186 个全存储库生成任务,涵盖 11 种编程语言。仅给定一个自然语言规范和一个空工作区,Agent必须实现一个完整的、可安装的项目,以满足一套全面的隐藏测试。每项任务均由软件工程师与大语言模型合作构建;他们共同开发测试套件和相应的独立于实现的规范。为了确保任务得到明确指定并且实际上可以解决,我们进一步对它们进行迭代验证过程,其中自主Agent使用静态检查和从实际模型rollout中观察到的故障来审核和修复任务缺陷。通过评估 13 个前沿模型,我们发现端到端存储库生成能力存在很大差异,pass@1 范围从 11.7% 到 67.7%,提供了强大的模型差异化,同时为未来的进步留下了相当大的空间。对智能体轨迹的分析进一步揭示了长期的、前置的推理模式,突出了从头开始构建工作代码库所需的规划和系统级推理。