论文
SWE Atlas:超越问题解决方案的 编码智能体 基准测试
SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution
摘要
我们推出了 SWE Atlas,这是 编码智能体 的基准套件,涵盖三个专业软件工程工作流程:代码库问答(124 项任务)、测试编写(90 项任务)和重构(70 项任务)。 SWE Atlas 与之前的 SWE 基准在三个关键方面有所不同:它针对代表性不足但实际上很重要的任务类别,使用全面的特定类别评估协议,并采用更好地反映现实世界使用情况的未指定的代理任务公式。其评估框架将程序性检查与基于标准的评估相结合。这超出了功能正确性、评估软件工程质量的范围,包括测试和重构完整性、可维护性、可重用抽象和代码库卫生。我们在 SWE Atlas 上评估了一系列前沿和开放权重模型,发现 GPT-5.4 和 Opus 4.7 实现了最强的整体性能,而即使是最好的开放权重模型得分也很差。我们的分析表明,顶级模型依赖于广泛的代码库探索和运行时驱动的推理。然而,即使是顶级模型也始终难以应对微妙的边缘情况、复杂的运行时分析以及遵守软件工程最佳实践。总体而言,SWE Atlas 提供了一个补充评估套件,用于测量 编码智能体 中的正确性和工程质量。