论文

编码智能体 的需求澄清、规划和代码生成的统一问题解决基准

A Unified Issue Resolution Benchmark for Requirement Clarification, Planning, and Code Generation for Coding Agents

智能体系统Agent任务评测

摘要

大语言模型 支持的 编码智能体 越来越多地用于修改现有代码存储库,例如,通过添加功能或修复错误。然而,现有的存储库级基准通常仅评估最终补丁是否通过测试。满足用户请求需要一长串相互依赖的推理和决策:代理必须恢复显式和隐式的需求,制定基于存储库的实施计划,并将其转换为正确的代码。通过/失败结果无法表征不成功的轨迹如何偏离正确补丁所需的要求和实施过程。为了弥补这一差距,我们引入了 SWE-RPG,这是一个存储库级基准,它将可执行补丁评估与经过验证的 真值 参考 (GT) 相结合,用于 (1) 需求澄清和 (2) 实施规划。这些中间 GT 支持对整个编码代理轨迹进行回顾性、与 GT 一致的诊断,包括澄清、规划、代码生成和工件提交。 SWE-RPG 包含来自 31 个 Python 和 Java 存储库的 163 个任务,其中包括 113 个错误修复和 50 个功能添加。我们评估了 3 个 编码智能体,包括 Claude Code、Codex 和 OpenCode,以及 6 个 大语言模型 后端,包括 Claude-Sonnet-5 和 GPT-5.6-Terra。结果表明,受评估的流行 编码智能体 仍然难以在现有存储库中实现用户请求,在 SWE-RPG 上的平均解决率仅为 31.5%。中级GT诊断进一步确定隐式需求恢复是主要瓶颈,占代理运行的24.5%--46.0%。这一结果表明隐式需求恢复是改进 编码智能体 的关键候选方向。基准数据和评估代码可在https://github.com/Xin-Zhou-smu/SWE-RPG-Bench获取。