论文
代理软件工程基准衡量什么?分析任务需求和座席行为,超越类别标签所显示的范围
What Does an Agentic Software Engineering Benchmark Measure? Profiling Task Demands and Agent Behaviour Beyond What Category Labels Reveal
摘要
代理软件工程基准通常通过名义类别标签来概括,例如“错误修复”或“功能实现”,但带有相同标签的基准是通过非常不同的管理管道构建的。因此,标签很少透露基准测试所需的工程工作。我们引入了传播-新颖性-中心性(SNC)配置文件,这是基于经验软件工程研究的存储库级编码任务需求的三轴表征。我们将该配置文件应用于三个尺度的五个广泛使用的基准和两个模型系列的 14,922 个轨迹,并报告了三个发现。 (1) 标签是任务需求的不可靠代理,因为每对基准在至少两个 SNC 轴上在统计上是分离的,并且分离可以追溯到特定的管理决策。 (2) 代理行为揭示了人类编写的标准解决方案无法做到的要求。代理会产生比标准更大的解决方案,其中问题陈述隐含暗示,而较小的解决方案则使标准膨胀。任务的措辞方式决定了代理的产出。 (3) 任务需求与成功一致相关,对于每个家庭和规模,已解决的运行集中在低 SNC 区域,而成功的行为特征是特定于家庭的。 Claude 通过匹配标准解决方案的范围取得了成功,其文件的平价份额从最小规模的 0.17 美元上升到最大规模的 0.54 美元。 Qwen 的成功在于在各个方面都超出了标准范围,而编辑太少则标志着两个家族的失败。