论文

一致性崩溃:诊断代码代理在达到正确代码后失败的原因

Coherence Collapse: Diagnosing Why Code Agents Fail After Reaching the Right Code

智能体系统Agent任务评测

摘要

代码代理解决了 65-70% 的 SWE-bench Verified 问题,但 Pass@1 无法告诉我们为什么其余问题失败,而且正如我们所表明的,在没有轨迹数据的情况下,有能力的模型故障会被系统地误诊。我们引入了 TRAJEVAL,这是一种将智能体轨迹的 无需训练 分解为参考补丁对齐的搜索、读取和编辑阶段,并将其应用于跨越三种架构和七个模型的 16,758 个轨迹。有能力的模型的主要故障不是本地化:SWE-Agent 和 OpenHands 上的 60-69% 的故障达到并编辑了正确的函数,但仍然产生不正确的补丁,并且对于仅 bash LiveSWEAgent 上的大多数模型来说,这种模式仍然存在。在这个编辑质量残差中,我们确定了 Coherence Collapse,即代理到达正确的代码,然后覆盖或破坏它,作为最大的主题,在 SWE-bench Verified 和多语言 PolyBench Verified 之间复制。在 5 种情况下,代理会生成与标准参考中间轨迹位相同的补丁,并在稍后将其销毁;编辑-提交检查点根据 SWE-bench Docker 工具恢复所有 5 个检查点。无参考共识驱动的变体在 GPT-5 上产生定向 +3.0 pp Pass@1 测量结果 (p=0.08)。