论文

SWE-Marathon:智能体能否自主完成超长视野软件工作?

SWE-Marathon: Can Agents Autonomously Complete Ultra-Long-Horizon Software Work?

模型评测基准与评测资源

摘要

人们越来越期望人工智能代理能够完成长期的工作流程,这些工作流程需要在数小时、数百万个词元和复杂的环境中持续取得进展。然而,当前的代理基准测试主要评估简短的任务,例如单个拉取请求、小票或 5-10 分钟的练习,限制了我们衡量代理在规划、长上下文理解和内存使用方面的能力。我们推出 SWE-Marathon,这是涵盖软件工程和相邻技术领域的 20 项长期任务的基准。每个任务都包含一个独特的可执行环境、一个人工编写的参考解决方案和一个多层验证套件。记录的代理尝试平均总词元数为 2720 万个,这使得 SWE-Marathon 的范围比现有的 SWE 和命令行代理基准要长得多。当前前沿 编码智能体 只能解决不到 30% 的任务。失败通常是由于自我验证不力、自我报告不可行和过早终止造成的。我们还在 13.8% 的执行轨迹中观察到 奖励作弊 行为,其中代理尝试利用环境或验证程序来绕过预期的工作流程。 SWE-Marathon 包括对测试套件和执行环境的对抗性审查,以及旨在防止捷径解决方案的多层检查。我们在 https://swe-marathon.org/ 发布了 SWE-Marathon、评估代码和代理轨迹。