论文
根本原因归因是搜索问题:持续搜索长时域智能体失败
Root-Cause Attribution Is a Search Problem: Continual Search for Long-Horizon Agent Failures
摘要
长时域任务中AI智能体的广泛应用产生了海量执行日志。在这些日志中诊断失败对提升可靠性至关重要,因为它能将结果级信号转化为可操作的干预措施。由于数据规模巨大,人工审查不现实,亟需自动化根本原因归因(RCA)方法。然而,基于大语言模型(LLM)的自动化RCA方法诊断准确率较低,尤其在执行轨迹变长时表现不佳。这是因为相关证据往往稀疏、分散于遥远的动作中,且与可见的失败表现脱节,导致归因问题退化为大规模搜索问题。现有RCA方法通常依赖单次LLM判断从执行轨迹中诊断失败。虽然在短轨迹中有效,但这些判断往往早期就得出一个合理结论,导致长轨迹中关键证据未被充分考察。我们提出了Continual Search,一种迭代框架,通过连续的回合引导判别器持续搜索未解决的诊断证据。我们在四个现有的RCA基准上评估了该方法。鉴于当前基准缺乏大规模执行轨迹,我们引入了MegaRCA-Mix以实现大规模RCA评估。MegaRCA-Mix提供了一个具有挑战性的测试平台,包含50个人工标注的失败案例,覆盖长时域、高执行量任务。在多个基准集和模型家族中,Continual Search始终能提升归因性能。例如,在MegaRCA-Mix上,其将GPT-5.5的F1分数提升超过40%,从0.349提升至0.498。更有趣的是,在同一模型家族内,低层级模型甚至能超越高层级模型,表明有效的搜索能力优于单纯模型规模。
