论文

是什么让软件问题解决任务对代理来说变得困难?

What Makes Software Issue Resolution Tasks Difficult for Agents?

智能体系统Agent任务评测

摘要

背景。代理系统的进步同时且迅速地使基准饱和。尽管存在这种经常讨论的现象,但由于缺乏对任务难度的控制和表征,基准分数仍然难以解释。更具体地说,我们目前对是什么使一项任务比另一项任务更难以及从静态任务属性可预测任务难度到什么程度知之甚少。目标。我们提出了一个测量框架来调查和系统地量化软件任务的结构属性与问题解决任务的代理成功率相对应。方法。我们通过跨任务补丁、存储库和提示提取特征,对迄今为止最大的 编码智能体 轨迹开放数据集 CoderForge-Preview 进行了大规模实证研究。我们使用集成方法、SHAP 归因和效应量分析评估了每个特征对任务结果的预测能力。结果我们发现任务难度基本上可以通过静态特征预测(AU C = 0.863),并且很大程度上是由补丁碎片和存储库规模驱动的。在中段任务的顶尖贡献者中,及时的语言特征变得明显,揭示了难度的分层结构。结论。问题解决任务的难度被编码在其结构中。这使得静态、事前难度估计成为可能,并为用于评估代理的难度控制基准构建奠定了基础。