论文

SWE-Bench ProMax:大规模多语言代码重构的基准测试代理

SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring

智能体系统Agent任务评测

摘要

随着 AI 编码智能体 承担日益复杂、长期的软件工程任务,现有的基准测试正在迅速饱和,其评估质量也受到了严格的审查:最近的一项审计发现,近 60% 的未解决的 SWE-bench Verified 实例包含有缺陷的测试 - 要么过于狭窄的测试拒绝正确的解决方案,要么过于广泛的测试检查未声明的需求 - 并且前沿模型可以从训练数据中逐字重现参考补丁。代码重构需要跨多个文件进行协调一致的、保留行为的更改,这为代理能力提供了更困难、更现实的测试,但当前的基准测试仍然服务不足。我们推出了 SWE-Bench ProMax,这是一个专家策划的多语言代码重构基准测试,包含 170 个实例,这些实例来自七种编程语言(Python、Java、TypeScript、Go、C、C++ 和 Rust)的真实提交。每个实例都经过严格的多阶段管理,直接解决先前基准测试中发现的质量问题:问题描述从头开始重写,以提供精确、明确的规范,并手动审查测试套件以删除过于狭窄和过于广泛的测试。复杂性不足或跨文件范围有限的任务被过滤掉,产生具有挑战性的大规模重构任务基准,平均每个实例有 11.4 个修改文件和 261.6 行代码,大大超过了现有基准的规模。两个代理支架下的前沿模型实验表明,最佳模型仅实现 41.2% 的解析率,证实 SWE-Bench ProMax 对当前的 AI 编码智能体 提出了有意义且不饱和的挑战。我们的基准测试可在 https://huggingface.co/datasets/swe-bench-promax/SWE-Bench-ProMax 上获取。