论文

EviRCA:从微服务根本原因分析的推理中解耦证据提取

EviRCA: Decoupling Evidence Extraction from Reasoning for Microservice Root-Cause Analysis

上下文与知识上下文工程

摘要

根本原因分析 (RCA) 是维护现代微服务系统的一项关键但劳动密集型任务,使其成为大型语言模型 (LLM) 的有吸引力的目标。最近的代理方法允许大语言模型通过生成和执行代码来迭代地探索原始遥测数据,要求单个模型同时检索证据、定位故障并推断大量异构遥测数据的根本原因,这会导致高计算成本、不稳定的行为和有限的诊断准确性。然而,原始遥测数据由数字指标、结构化跟踪和机器生成的日志组成,不直接适合 LLM 处理。我们提出了 EviRCA,一个基于 LLM 的 RCA 框架,它将确定性证据提取与 LLM 推理分离。与系统无关的提取阶段将原始指标、跟踪和日志转换为一组紧凑的忠实多模式证据卡,而大语言模型仅通过一小组预定义的只读工具对这些结构化观察结果进行推理,而无需访问原始遥测或执行代码。我们在 OpenRCA 上评估 EviRCA,这是一个根据跨三个企业系统的真实异构遥测构建的基准。 EviRCA 在两个不同的 LLM 中实现了 40.6%-43.9% 的正确率,大大优于之前达到 15.2% 的 OpenRCA 基线,同时将词元消耗减少了 15-26 倍,执行时间减少了 3-20 倍。此外,EviRCA 解决了需要对时间、组件和根本原因进行同步推理的难题,而以前的方法报告的性能接近于零。我们的过程级失败分析进一步表明,瓶颈在于判断提取阶段已经出现的证据,而不是寻找它,这表明基于LLM的RCA的有效性在很大程度上取决于证据提取的质量。