论文
SWE-Touch:当用户触摸代码时对 编码智能体 进行基准测试
SWE-Touch: Benchmarking Coding Agents When Users Touch the Code
摘要
现实世界的软件开发需要 编码智能体 在共享工作区中运行,用户可以在正在进行的任务期间检查和修改代码,但现有的存储库级基准通常会评估单独工作的代理或限制用户参与消息。这让我们不禁要问:编码智能体 如何理解和响应共享工作区中的代码更改?我们引入了 SWE-Touch,这是一个通过经过验证的 Counter-Edits 对该设置进行压力测试的框架:对与任务完成相冲突的任务相关代码进行合理的编辑。 SWE-Touch 从多个修复轨迹中挖掘任务关键区域,使用单独的用户补丁生成器来构建编辑,并在代理到达相关代码时将上下文用户消息注入其中。我们在 SWE-bench Verified 上评估了九个编码模型,并对 SWE-Bench Pro 和 DeepSWE 的长期任务进行了额外的实验。 Counter-Edit 在 SWE-bench Verified 上将平均解决率降低了 7.7 个百分点,并且在两个长期基准上也持续存在降级现象。轨迹分析将这些失败与不断发展的工作空间的有限意识联系起来:代理可能会保留冲突的代码或替换它,而没有充分地重新检查存储库并通过有针对性的测试来验证修改后的代码。这些发现表明,强大的自主性能尚不能确保共享工作空间协作所需的状态感知和自适应行为,并指出检测工作空间变化、协调与任务冲突的编辑以及验证受影响的行为作为未来优化的关键功能。