论文

根本原因归因是搜索问题:持续搜索长时域智能体失败

Root-Cause Attribution Is a Search Problem: Continual Search for Long-Horizon Agent Failures

AI 基础设施可观测性

摘要

长时域任务中AI智能体的广泛应用产生了海量执行日志。在这些日志中诊断失败对提升可靠性至关重要,因为它能将结果级信号转化为可操作的干预措施。由于数据规模巨大,人工审查不现实,亟需自动化根本原因归因(RCA)方法。然而,基于大语言模型(LLM)的自动化RCA方法诊断准确率较低,尤其在执行轨迹变长时表现不佳。这是因为相关证据往往稀疏、分散于遥远的动作中,且与可见的失败表现脱节,导致归因问题退化为大规模搜索问题。现有RCA方法通常依赖单次LLM判断从执行轨迹中诊断失败。虽然在短轨迹中有效,但这些判断往往早期就得出一个合理结论,导致长轨迹中关键证据未被充分考察。我们提出了Continual Search,一种迭代框架,通过连续的回合引导判别器持续搜索未解决的诊断证据。我们在四个现有的RCA基准上评估了该方法。鉴于当前基准缺乏大规模执行轨迹,我们引入了MegaRCA-Mix以实现大规模RCA评估。MegaRCA-Mix提供了一个具有挑战性的测试平台,包含50个人工标注的失败案例,覆盖长时域、高执行量任务。在多个基准集和模型家族中,Continual Search始终能提升归因性能。例如,在MegaRCA-Mix上,其将GPT-5.5的F1分数提升超过40%,从0.349提升至0.498。更有趣的是,在同一模型家族内,低层级模型甚至能超越高层级模型,表明有效的搜索能力优于单纯模型规模。

根本原因归因是搜索问题:持续搜索长时域智能体失败:论文配图
图 1:根本原因归因策略的比较。标准基线,如一次性判断、自我一致性和异质评审小组,对证据进行一次传递。被动继续促使法官在正在进行的庭审中反复重新考虑其诊断,但并不强制要求进一步探索。相反,持续搜索要求法官在每个连续的回合中质疑其固定答案,并在支持它的证据之外进行搜索。