论文
DeepSWE:测量原始长期工程任务的前沿 编码智能体
DeepSWE: Measuring Frontier Coding Agents on Original, Long-Horizon Engineering Tasks
摘要
DeepSWE 是用于评估 编码智能体 的 113 个原始长期软件工程任务的基准。大多数公共代理编码基准都遵循 SWE-bench 从公共 GitHub 存储库中挖掘合并的修复程序,这会产生两个问题:修复程序及其讨论很可能在预训练期间看到,因此高分可以反映回忆而不是解决问题;每项任务都通过其合并修复程序附带的测试进行评分,这些测试是为了确认一个特定的修复程序而编写的,而不是对任意解决方案进行评分,因此他们可能无法通过正确的替代方案或通过不完整的替代方案。 DeepSWE 避免了这两种情况。它的任务是在 91 个活跃的开源存储库和五种语言中从头开始编写的,并且永远不会向上游贡献,因此它们的参考解决方案不会出现在 模型训练 抓取的公共记录中;每个任务都由手写验证程序进行评分,该验证程序检查所请求的功能并接受提供该功能的任何实现。当独立的 LLM 法官重新审查评分运行时,它与 DeepSWE 验证者的意见不一致的频率比 SWE-Bench Pro 的继承测试低一个数量级(1.4% 与 32.4%)。尽管 DeepSWE 的提示长度约为 SWE-Bench Pro 提示长度的一半,但 DeepSWE 的提示所描述的任务的参考解决方案涉及的代码量要多 5.5 倍,而且该基准测试将前沿智能体划分在比它们聚集的排行榜更宽的分数范围内。我们发布基准、其验证者以及评估轨迹的完整记录。