论文

SWE-Cycle:在整个问题解决周期中对代码代理进行基准测试

SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle

智能体系统Agent任务评测

摘要

随着自主代码代理走向端到端软件开发,评估其实际自主性变得至关重要。当前的基准测试通过在预先配置的环境中测试代理来隐藏摩擦,并且它们的静态评估管道在解析完全自主的轨迹时经常失败。我们通过 SWE-Cycle 解决了这些限制,这是一个包含 489 个严格过滤实例的基准。 SWE-Cycle 跨三个独立任务评估代理,包括环境重建、代码实现和验证测试生成,以及集成这三个任务的端到端 FullCycle 任务。 FullCycle 任务要求代理在没有人工脚手架的情况下在裸存储库中自主工作。为了可靠地评估这些复杂的执行路径,我们开发了 SWE-Judge。通过将静态代码审查与动态测试相结合,这种具有执行能力的评估代理可以准确地验证功能的正确性,并消除传统静态解析器的系统测量错误。我们在这四项任务中评估了由六种最先进的 LLM 提供支持的代码代理。结果表明,从孤立任务过渡到全周期执行时,解决率急剧下降,暴露了处理跨阶段依赖关系和维护代码质量方面的关键瓶颈。 SWE-Cycle 和 SWE-Judge 共同提供了一个全面的框架,用于准确测量自主软件代理的端到端能力。