论文

编码智能体 不知道何时行动

Coding Agents Don't Know When to Act

模型评测基准与评测资源

摘要

编码智能体 越来越多地部署用于自主维护软件,包括解决用户报告的问题:收到错误报告后,代理会创建补丁来解决该问题。然而,在任何实际部署中,他们都会遇到有关已解决问题的陈旧错误报告。代理商应该认识到这一点,并避免修改代码,以避免积累技术债务。为了系统地评估当前代理是否这样做,我们引入了FixedBench,这是一个代码基准测试,包含 200 个人工验证的编码任务,其中不需要更改代码,跨四个代理工具测试了五个最新模型。我们发现,即使是最先进的模型也会失败,在 35%—65% 的案例中提出不需要的更改(不包括测试和文档)。在修补之前重现问题的明确说明部分解决了此问题,但引入了一种新的故障模式:当问题部分修复时,即使仍然需要修补程序,他们也会放弃。更广泛地说,我们的结果表明 LLM 陷入了行动偏见:即使不采取行动是适当的,他们也会选择采取行动。为了打破这种模式,需要明确地将不作为作为成功之路,这凸显了当前训练目标中隐含的对人类指导的过度依赖。