论文

TrajAudit:代理编码系统的自动故障诊断

TrajAudit: Automated Failure Diagnosis for Agentic Coding Systems

智能体系统Agent任务评测

摘要

代理系统已被广泛研究以自动化编码任务,例如错误修复和功能实现。随着这些系统越来越多地在复杂的代码库上运行,了解它们失败的位置和原因对于迭代改进和操作可靠性至关重要。现有的自动故障诊断方法利用 \textit{任务执行轨迹},但由于两个关键属性,它们难以应对存储库级 编码智能体 生成的轨迹。首先,这些轨迹通常很长,跨越许多执行步骤,使得 LLM 很难跟踪执行历史记录中的失败因果链。其次,这些轨迹充满了噪声,包含大量的低信号观察结果,例如冗余程序结构和冗长的代码上下文,这可能会干扰 LLM 推理。为了应对这些挑战,我们提出了 \textit{TrajAudit},这是一个专门针对存储库级 编码智能体 生成的轨迹的自动故障诊断框架。 TrajAudit 采用由两个模块支持的调查代理:一个通过语义显着性折叠减少与故障无关的噪声上下文,另一个从测试失败报告中得出初步诊断指导作为先验知识,以帮助 LLM 关注可能的故障区域。调查人员可以进一步调用工具来按需检查折叠内容,从而在不失去对完整轨迹上下文的访问的情况下进行集中调查。我们还引入了 \textit{RootSE},这是来自存储库级编码任务的 102 个现实实例的基准,每个实例都注释有最早的决定性错误步骤和理由。 RootSE 上的实验表明,在有参考设置和无参考设置下,TrajAudit 的精确故障定位精度分别比最强基线高出 10.8% 和 21.6%,证明了其有效性。