论文

SWE-Together:在交互式用户会话中评估 编码智能体

SWE-Together: Evaluating Coding Agents in Interactive User Sessions

智能体系统Agent任务评测

摘要

大多数编码代理基准测试都是静态的:代理预先接收完整的任务描述,并且仅根据其最终代码进行判断。真正的编码帮助是交互式的,用户可以多次澄清目标、添加约束并纠正错误。我们引入了 SWE-Together,这是一个根据真实用户代理编码会话重建的多轮基准测试。为了使真实的交互可验证,我们从 11,260 个记录的会话中策划了 109 个存储库级任务,选择具有可恢复的存储库状态、明确的用户目标和可观察结果的会话。为了在代理之间重放这些交互,我们构建了一个基于 LLM 的反应式用户模拟器,该模拟器保留原始用户的意图,并在 编码智能体 的进度需要时提供反馈。为了评估代理作为协作者,我们测量最终存储库的正确性和交互过程中所需的纠正反馈轮数。前沿 编码智能体 的实验表明,更强的代理通常会实现更高的最终成功率,同时需要更少的干预,这表明用户体验得到改善。