论文

SWE-INTERACT:将 SWE 基准重新构想为用户驱动的长期编码会议

SWE-INTERACT: Reimagining SWE Benchmarks as User-Driven Long-Horizon Coding Sessions

智能体系统Agent任务评测

摘要

我们推出了 SWE-Interact,这是一个新的测试平台,用于在多轮、交互式、用户驱动的软件工程任务上评估 编码智能体。现有的前沿 SWE 基准通常会预先提供完整的要求,并评估代理的自主实施情况。相比之下,SWE-Interact 将代理置于现实的开发人员工作流程中:精心设计的用户模拟器从模糊或不完整的指令开始,逐步揭示需求,检查代理的工作空间,并提供有针对性的反馈、修订和新的约束,直到交付完整的任务目标。该设置基于对真实编码代理交互的大规模研究,测试代理是否能够发现用户意图、适应不断变化的需求并建立在自己之前的工作基础上。在一系列前沿和开放权重模型中,我们发现单轮 SWE 任务的强大性能并不能可靠地转移到多轮、用户驱动的工作流程:性能最佳的模型解决了大约 50% 的单轮基线任务,但只能解决 25% 的相应 SWE-Interact 任务。我们评估中最强大的模型,包括 Opus 4.8 和 GPT 5.5,即使面对模糊的初始指令,也能坚强地开始,坚持下去,直到用户提出所有要求,更好地集成它们并编写干净的代码。然而,他们仍然遭受过度代理编码、忘记需求和技术错误的困扰。较弱的模型在含糊不清的情况下起步很差,过早放弃,忘记或忽略指令并更多地返工代码。总体而言,SWE-Interact 衡量了前沿模型开发的正交、现实世界能力轴:交互式目标发现和循环中用户的迭代细化。