论文
超越解决率:编码智能体 成功和失败的行为驱动因素
Beyond Resolution Rates: Behavioral Drivers of Coding Agent Success and Failure
摘要
编码智能体 代表了自动化软件工程的新范例,它将 大语言模型 (LLM) 的推理功能与工具增强的交互循环相结合。然而,编码智能体 仍然有严重的局限性。排名靠前的基于 LLM 的 编码智能体 在超过 20% 的基准测试问题上仍然失败。然而,我们对Agent失败的原因(即原因)以及失败如何在行为上表现缺乏系统的理解。我们提出了一项大规模实证研究,分析了 19 个智能体(8 个 编码智能体 框架,14 个 LLM)在 500 项任务上的 9,374 条轨迹。我们围绕三个研究问题进行分析。首先,我们调查了代理在特定任务上失败的原因,发现补丁复杂性本身并不能解释困难:12 个从未解决的任务只需要简单的补丁,并且被人类注释者认为很容易,但所有代理都由于架构推理和领域知识的差距而失败。其次,我们研究行为模式如何区分成功与失败。一旦任务难度得到控制,轨迹长度和失败之间的相关性就会被广泛报道,从而逆转方向,这表明这是一个混杂因素。相反,轨迹结构始终如一地进行区分:在编辑之前收集上下文并投资于验证的代理更容易成功,并且这些策略是由代理决定的,而不是任务自适应的。第三,我们将 LLM 功能与框架设计分开,发现 LLM 是结果和行为的主要驱动因素:共享相同 LLM 的代理比共享相同框架的代理同意更多的任务,并且框架性能差距随着每一代 LLM 的改进而缩小。框架提示确实会影响代理策略,但这种影响会随着 LLM 的增强而减弱。