论文

SWE-Bench Pro Verified:更可靠的软件工程Agent基准

SWE-Bench Pro Verified: A Reliable Benchmark for Software Engineering Agents

智能体系统Agent任务评测长程任务评测

摘要

SWE-Bench Pro 已成为评估软件工程智能体在具有挑战性的存储库级任务方面的标准基准。然而,我们的分析工作表明,其评估受到两个不可靠性来源的破坏:奖励投机,由泄露参考标准解答或隐藏的评估信息引起,以及任务质量问题,包括误导性的问题陈述和范围不当的测试。这些问题可能会提高基准性能并掩盖智能体的真实编码能力。我们推出 SWE-Bench Pro Verified,这是 SWE-Bench Pro 的验证版本,可以解决这两个问题。我们的方法结合了 防奖励投机 保护措施,可以在不破坏正常智能体功能的情况下消除主要泄漏渠道,以及 任务修正 可以最小化纠正有缺陷实例中的不一致。对 SWE-Bench Pro Verified 的评估表明,某些模型的性能比之前报告的要差得多,这表明 SWE-Bench Pro 的现有结果可能高估了真实的软件工程能力。 SWE-Bench Pro Verified 为评估软件工程智能体提供了更值得信赖的基准。