论文
RealSWE:真实用户请求下编码智能体的组合式评估
RealSWE: A Compositional Evaluation of Coding Agents under Realistic User Requests
摘要
现在,编码代理通常在 SWE-bench 基准系列上进行评估,其任务是根据策划的 GitHub 问题构建的:长、结构化且信息丰富。然而,真实的用户请求通常更短且结构更少。为了描述这一差距,我们定义了六类信息分类法和语言风格的四个维度,并将它们应用于 SWE-chat 的真实用户提示以及 SWE-bench Verified 和 Pro 的问题陈述。我们发现仅携带问题陈述(单独或带有有限附加上下文)的请求占实际提示的 88%,但仅占基准问题的 7%。此外,87% 的真实提示是随意编写的,而 94% 的基准问题是正式的。在这些观察的指导下,我们引入了 RealSWE,这是源自 SWE-bench Verified 和 Pro 的 381 个多变体任务系列。每个家族中的变体都具有相同的基本任务和黄金补丁,仅在信息组成和语言风格上有所不同。使用 RealSWE 评估七个当代LLM,我们发现 i) 现实输入平均将分辨率降低 6.4 个百分点,并且可以改变模型排名。受控分析进一步表明,ii) 包括期望行为和动机会显着影响性能,而环境信息和复制步骤仅添加标记,而没有可衡量的效益; iii) 语言风格只有很小的、依赖于模型的影响。这些发现为用户和代理提供了可操作的指导:明确说明所需的行为和动机,而大多数真实的提示都忽略了这一点,从而大大提高了LLM的软件工程表现。
