论文

学习何时以及如何进行干预:编码Agent事后总结的哨兵

Learning When and How to Intervene: A Hindsight-Distilled Sentinel for Coding Agents

智能体系统Agent 动作执行与治理

摘要

编码Agent通过一系列操作来解决存储库级任务,其中单个错误操作可能会误导后续决策并增加恢复成本。现有方法使用执行反馈进行恢复或专门检查来阻止错误,但在执行之前决定干预是否有利于最终任务完成仍然具有挑战性。为了应对这一挑战,我们提出了 HiSentinel,这是一个事后蒸馏框架,可以训练轻量级 0.6B 和 1.7B 哨兵来选择执行前干预措施,旨在提高任务完成度,而不是纠正每一个不完美的动作。享有特权的教师使用记录的执行结果作为干预判断的证据,这些结果被提炼成因果学生,仅接收行动前的背景和建议的行动。除了确定是否以及何时进行干预之外,哨兵还必须提供可操作的反馈,帮助编码Agent恢复或获得必要的人工输入。为了支持这些功能,我们引入了 SWE-Intervene,这是一个根据软件工程轨迹构建的操作级数据集,它注释是否应该允许、自动重定向或暂停操作以进行人工协助,以及相应的干预反馈。在 SWE-bench Verified Mini 和 Ask or Assume 中,HiSentinel 持续改进了 Sentinel 规模和编码Agent系列的任务完成情况,分别提高了 14% 和 10%,同时保持了具有竞争力的词元消耗。这些结果表明,轻量级的执行前干预可以有效防止错误传播并提高自主编码Agent的可靠性。