论文
SWE-Chain:对链式发行级包升级进行 编码智能体 基准测试
SWE-Chain: Benchmarking Coding Agents on Chained Release-Level Package Upgrades
摘要
人们越来越期望由 大语言模型 提供支持的 编码智能体 能够执行超越孤立问题解决的实际软件维护任务。现有的基准已经转向现实的软件演进,但它们很少以包发布的粒度捕获持续维护,其中更改被捆绑、交付并由后续版本继承。我们推出了 SWE-Chain,这是一个评估代理链式发布级包升级的基准,其中每个转换都建立在代理先前的代码库上。为了生成升级规范,我们设计了一个分而治之的综合管道,将发行说明与每个版本转换的代码差异保持一致,确保需求以实际代码更改为基础,为代理提供信息,并且可行。 SWE-Chain 包含跨 9 个真实 Python 包的 12 条升级链,具有 155 个版本转换和 1,660 个代码变更依据关联升级要求。在九个前沿代理模型配置中,代理在 Build+Fix 机制下平均实现了 44.8% 的解析度、65.4% 的精度和 50.2% F1,其中 Claude-Opus-4.7(Claude Code)以 60.8% 的解析度、80.6% 的精度和 68.5% F1 领先。这些结果表明 SWE-Chain 既可行又具有区分性,并表明当前的代理仍然难以在不破坏现有功能的情况下跨链包版本进行正确升级。