论文

AI智能体为何在云根因分析中系统性失败?

Why Do AI Agents Systematically Fail at Cloud Root Cause Analysis?

智能体系统Agent任务评测

摘要

大规模云系统的故障会造成重大经济损失,使自动化根因分析(RCA)成为运维稳定的关键。近期工作利用大语言模型(LLM)智能体自动化这一任务,但即便使用能力强的模型,现有系统的检测准确率仍然很低,且当前评估框架只评估最终答案的正确性,不揭示智能体的推理为何失败。本文对基于LLM的RCA智能体进行过程级失败分析。我们在五个LLM模型上完整执行OpenRCA基准,产生1,675次智能体运行,并把观察到的失败归类为跨智能体内推理、智能体间通信和智能体-环境交互的12类陷阱。我们的分析显示,最常见的陷阱——尤其是幻觉式数据解读与不完整探索——在所有模型中持续存在,与能力层级无关,表明这些失败源于共享的智能体架构而非个别模型的局限。受控缓解实验进一步表明,仅靠提示工程无法解决主要陷阱,而丰富智能体间通信协议能把通信相关失败最多降低15个百分点。本工作提出的陷阱分类法与诊断方法为设计更可靠的云RCA自主智能体奠定了基础。