论文
SWE-TaskFlow:让编码Agent基准匹配真实用户工作流
Coding-Agent Benchmarks Should Match Their Users' Task Flows
摘要
编码Agent的评估通常力求尽可能现实。在我们的研究中,我们收集了 JetBrains IDE 中真实软件工程师的 4,782 个Agent会话,我们将其称为生产会话。由于我们的主题是交互式Agent,因此我们研究至少包含三个用户消息的会话(占样本的 33%)。这些长时间的会话与问题衍生的基准测试任务有两个不同之处:(i) 用户请求涵盖更广泛的任务类型组合 - 有关项目代码、规划、审查、重构、执行的问题 - 以及 (ii) 用户在整个会话中在类型之间切换。来自三个公共交互语料库的长会话样本表现出明显不同的任务流(会话长度、任务类型和类型到类型转换的分布),因此没有一个交互分布是普遍现实的:基准应该命名一个目标用例并根据它的测量进行校准。我们提出了 SWE-TaskFlow,一种用于转换任何源自问题的基准的方法:它保留经过验证的任务和测试,同时将交互引导至目标任务流 通过提示分割和可验证的存储库 QA,并使用任务流对齐分数 (TFAS) 在生成的轨迹中进行选择。在 700 个 SWE-Bench Pro 任务的试点中,在解决率没有稳定变化的情况下,分几个步骤顺序解决任务大约会使Agent成本增加一倍:交互协议本身是评估的一个重要维度。
