论文

使用双向重建和验证框架对 编码智能体 进行独立补丁验证

Independent Patch Verification for Coding Agents with a Bidirectional Reconstruct-and-Verify Framework

模型推理推理验证与自校正

摘要

由 大语言模型 提供支持的自主 编码智能体 现在可以直接从错误报告生成代码补丁,但仍然存在一个根本性的差距:一旦生成补丁,没有任何机制独立验证它是否真正解决了所报告的问题。先前的工作试图通过迭代自我改进和推理时间缩放来解决这个问题,但这些方法要么在生成补丁的相同解释下审查补丁,要么在不验证单个补丁的情况下扩大候选生成,并且都没有提供用于评估补丁正确性的明确验证信号。我们提出了 RETRACE,这是一个 无需训练 后生成验证框架,它通过双向重建和协调来导出这样的信号。当 编码智能体 生成问题的候选补丁时,RETRACE 会执行前向重建,以根据问题和代理的轨迹构建明确的修复原理;然后,向后重建仅从补丁及其轨迹而不访问原始问题,独立地推断补丁似乎要解决的问题的描述,并将此重建与原始问题进行比较以产生对齐判决;然后,协调阶段检查前向基本原理和补丁之间的一致性,诊断任何不一致的根源,并提交补丁或生成有针对性的修订指导。在 SWE-bench 上进行评估 通过两个骨干网(GPT-5-mini 和 MiniMax-2.5)进行验证,RETRACE 在 mini-SWE-agent 支架上分别将 Pass@1 提升了 7.0% 和 3.6%,并且无需修改即可在 OpenHands 上提供类似的增益。消融实验表明,前向和后向阶段都有助于整体改进,并且增加调节会产生进一步的收益。