论文
SWE-Journey:通过长视野、多轮交互对编码助手进行更现实的评估
SWE-Journey: Towards More Realistic Evaluation of Coding Assistants through Long-Horizon, Multi-Turn Interaction
摘要
Claude Code 和 Codex 等编码助手已成为 LLM 代理的主要应用,但现有基准与现实世界的使用相距甚远,特别是在任务范围和交互长度方面。代码助理需要在不断发展的存储库中完成长链的开发工作,同时通过多轮交互反复澄清需求并调整实现。为了解决这些差距,我们引入了 SWE-Journey,这是一个对编码助手进行更现实评估的基准。为了解决任务范围差距,我们提出了一种从弱到强的综合管道,可以自动构建长范围编码任务。为了解决交互差距,我们从真实交互数据中挖掘了四个代表性用户角色,并构建了一个用户模拟代理来重现真实的代码辅助交互。平均而言,模型通过了软件架构师所要求的功能的 75% 以上的测试,但对于非编码人员来说,只有不到 25%。这些结果表明,当前的编码助手仍然无法为非编码人员提供可靠的编码。我们 进一步分析造成这种差距的原因,将提出权利、发现权利、修复权利作为交互过程中的关键能力。