论文

根因分析在真实遥测数据上能走多远

How Far Can Root Cause Analysis Go on Real-World Telemetry Data?

智能体系统Agent 协作Agent Harness

摘要

在生产微服务故障中识别根因需要对横跨指标、日志与追踪的大规模多模态遥测推理——一个对经典方法与基于LLM的方法都已证明棘手的问题。OpenRCA数据集集中体现这些挑战:大规模、多模态、缺乏详细领域知识,且所有既有方法在其上准确率持续偏低。我们证明经典因果发现方法与既有基于LLM的多智能体系统在该基准上都无法可靠识别根因,并提出结构化多智能体RCA管线:大幅超越既有LLM与经典基线,同时支持领域知识与无知识两种运行模式。为诊断失败源自何处,我们引入反向推理智能体:给定正确答案,识别抽取异常中的哪些信号支撑它、并判定阶段1是否能接触到这些信号——把每个失败分类为推理鸿沟(证据在但未用)或数据歧义(证据确实缺失)。该分析揭示:绝大多数失败中所需证据是存在的——瓶颈不在数据访问,而在智能体正确推理它的能力。我们进一步引入自动规则挖掘管线:系统性地从反向推理报告抽取判别规则,降低对人工知识整理的依赖。跨全部配置:模型推理能力与领域知识是主要约束——更强模型内嵌更多领域专长,显式知识注入可部分补偿。即使证据抽取完美,推理表现仍有实际上限:脚手架工程与更好的数据管线无法弥合该差距;进展需要模型层面的改进。

根因分析在真实遥测数据上能走多远:论文配图
图 1:结构化多代理 RCA 系统概述。第 1 阶段(离线)计算每个数据集和每天的每个 KPI 统计数据和候选阈值;大语言模型根据其统计数据和数据集的根本原因模式为每个动态 KPI 分配四种异常检测方法(P95、P5、布尔、ROC)之一,然后以统计方式设置阈值。第 2 阶段将冻结阈值应用于每个 30 分钟的查询窗口,以提取异常指标行,将未经过滤的日志和跟踪作为辅助证据传递。第 3 阶段对此证据的推理:单个第 1 阶段代理(一个 LLM 调用)执行枚举、聚类、分析、选择和反映,在所有模式下接收系统元数据和原因词汇,在 DK ON 模式下接收域推理规则和组件分类;然后,配置代理强制输出词汇表以产生预测 ⟨\langlecomponent、reason、timestamp⟩\rangle。