论文

编程代理的在线监控和纠正指导

Online Monitoring and Corrective Steering of Programming Agents

智能体系统Agent 架构与控制循环

摘要

修复大型项目中的 GitHub 问题是一项长期任务,特别是当修复需要跨多个位置进行更改或问题描述缺乏本地化和修复所需的信息时。因此,代理会经历很长的轨迹,很容易出现效率低下和错误:它们偏离预期计划,重复失败的操作,或者在没有工作补丁的情况下终止。本文提出 LivePlan 来实时监控、检测和纠正此类行为低效和偏差。 LivePlan 将判断与建议解耦:确定性的、基于规则的监视器检查轨迹上的一般信号以检测问题,而无需调用 LLM,并且仅当检测到问题时,它才会咨询顾问 LLM 以进行高级的下一步纠正。这种设计避免了先前方法中误导性的重新规划和昂贵的干预。我们在 SWE-agent 之上实施 LivePlan,并在 SWE-bench Verified 和 SWE-bench Pro 中使用五个 LLM(三个作为执行代理,两个作为顾问)对其进行评估。与普通的 SWE-agent 相比,LivePlan 显着提高了问题解决率,实现了高达 15.2% 的持续收益(平均:9.9%),同时每个实例仅产生 0.08 美元的额外成本。其他解决方案集中于中型和硬型实例。 LivePlan 在解决率方面始终优于其他方法,对已经成功运行的回归最小,并且在没有基线解决的问题上取得新的成功。