论文
ChainSWE:针对多 Bug 软件维护对 编码智能体 进行基准测试
ChainSWE: Benchmarking Coding Agents on Multi-Bug Software Maintenance
摘要
语言模型 (LM) 代理越来越多地被部署来长期维护代码库,修复相关缺陷流,同时将上下文从一个修复传递到下一个修复。然而,现有的软件工程 (SWE) 基准测试每次评估模型一个错误:重置存储库,重新读取代码库,并对单个独立问题进行单独分级。此设置将持续维护工作流程折叠为一系列独立的会话,忽略了使现实世界的错误修复变得具有挑战性的累积依赖性。为了弥补这一差距,我们引入了 ChainSWE,这是第一个用于评估共享代码库中顺序、相关错误修复代理的基准。我们收集了 54 个 Python 项目中 304 个问题的时间链,这些问题是从 6 个 SWE-bench-family 数据集中挖掘的。我们对一系列代理和模型的评估表明,随着链长度的增加,性能始终下降高达 70%。