论文
解析率隐藏了什么:编码智能体 的轨迹结构诊断
What Resolve Rate Hides: Trajectory Structure Diagnostics for Coding Agents
摘要
编码智能体 几乎完全按照解决率进行排名:他们的最终补丁是否通过目标测试。然而,两个代理可以通过截然不同的过程达到相同的结果,并且单个通过/失败标签没有说明运行失败的原因或接受的运行为何花费额外的步骤、时间或词元。该过程证据存在于轨迹中,它记录了运行的搜索、读取、编辑、工具调用、验证和还原。然而,原始痕迹是异构的并且很难在运行之间进行比较。我们提出了 TraceProbe,一个轨迹诊断框架,可以恢复解析率隐藏的内容。 TraceProbe 将每个原始运行规范化为具有确定性效果标签的规范九类操作分类法,然后应用两个基于规则的模块:Insight 命名根据已建立的调试实践(例如搜索循环、验证跳过)改编的单轨迹反模式,而 Converge 则对齐运行对并对其行为在受控引用下的差异进行分类。将 TraceProbe 应用到 SWE-Bench Verified 上 5 个生产设置的 2,500 个轨迹上,我们发现 (i) 文件选择太粗略,无法区分成功与失败,而函数选择和完成行为则对其进行了本地化; (ii) Insight反模式主要作为语料库级别的难度线索,搜索循环最稳定; (iii) 即使已解决的运行,其到达相关代码的速度以及发生的失败工作量也有所不同。因此,轨迹结构通过定位检查目标、提出故障假设以及优先审查运行,为结果添加了可审核的诊断背景。