论文

SWE Refactor Bench:编码智能体 能否完成长期、全存储库堆栈迁移?

SWE Refactor Bench: Can Coding Agents Complete a Long-Horizon, Whole-Repository Stack Migration?

智能体系统Agent任务评测长程任务评测

摘要

现代软件系统在数十年的开发过程中积累了技术债务,这使得迁移成本高昂且主要是手动迁移。随着 编码智能体 修复错误的能力越来越强,它们能否自主执行此类迁移?现有的基准无法回答这个问题,因为它们只评估行为的正确性,而不评估迁移是否实际发生。这导致了一个简单的黑客攻击:代理复制原始实现以使测试通过。我们称之为盲目性。为了解决这个问题,我们引入了 SWE Refactor Bench,这是一个包含 20 个全存储库迁移的基准测试,涵盖 4 种技术债务。三阶段评估协议可衡量迁移完整性和行为正确性。 (1) 迁移审核验证迁移是否发生。 (2) 行为测试使用固定的测试套件来衡量正确性。 (3) Agentic Verification使用6个独立的编码智能体来生成针对隐藏行为差异的针对性测试。在来自 8 个前沿模型和 26 个模型努力配置的 520 次运行中,520 次运行中只有 28 次($5.4\%$)通过了所有三个阶段,20 个任务中有 13 个没有收到可接受的解决方案,最佳模型 (claude-opus-5) 得分为 47.0/100$。迁移完整性和行为正确性是不同的能力:一些运行通过跳过迁移来保留行为,并在迁移审核时停止;大多数人尝试这样做并破坏行为,并在行为测试中停止。代理无法提供完美的迁移:在通过迁移审核的 340 次运行中,$58\%$ 达到 $99\%$ 的固定检查,但只有 $26\%$ 达到 $100\%$。代理能力因迁移类别而异:代理在构建工具链重写方面得分为 31.4 美元,但在语言重写方面仅得分 5.6 美元。总之,这些发现使 SWE Refactor Bench 成为开发 编码智能体 以实现可靠的整个存储库迁移的严格测试平台。