论文

EvoCause:用于根本原因分析的 LLM 引导因果图演化

EvoCause: LLM-Guided Evolution of Causal Graphs for Root Cause Analysis

上下文与知识知识图谱

摘要

当组件发生故障时,现代电信、云和微服务系统会发出相关的级联警报。根本原因分析 (RCA) 旨在识别启动每个级联的一小部分警报。一种常见的方法是从观察日志中学习因果图,并预测每个事件引发的子图中的所有零度警报。然而,学习到的图仍然是固定的,无法从历史事件的专家诊断中受益。我们用 EvoCause 关闭这个循环。专家标签限制哪些警报应该是源节点,但不指定满足这些限制所需的边缘编辑。 EvoCause 使用 大语言模型 (LLM) 提出语义上合理的图形编辑,而确定性代码验证节点身份和非循环性,并保留标记对齐集上的最佳图形。在测试时,精炼图单独产生透明预测,无需 LLM 调用。我们还发布了 TeleRCA,这是一个来自生产电信网络的专家注释基准,包含 $485{,}681$ 警报事件,涵盖 $194$ 警报类型,超过 $5{,}621$ 资源。在合成数据上,使用 PC 因果发现算法初始化的 EvoCause 优于未完善的 PC 基线,将 Node F1、Case EM 和 Graph F1 分别提高了 11.59、9.40和 4.59百分点,同时将 nSHD 降低了 0.2379。在 TeleRCA 上,用匿名标识符替换人类可读的警报标题可使节点 F1 和 Case EM 分别降低 6.12和 8.04百分点,这表明警报名称信息有助于图形细化。