论文
PropLLM:面向网络故障诊断的传播感知场景重建
PropLLM: Propagation-Aware Scene Reconstruction for Network Fault Diagnosis
摘要
网络故障沿着拓扑与协议依赖逐层传播,而运维系统通常只能观测到传播链末端的现象性告警,不同根因故障可能产生高度相似的端点症状。现有方法,无论是基于规则、基于机器学习(ML)还是基于大语言模型(LLM),本质上都是一次性地将告警集合映射为诊断,在结构上无法化解这种端点歧义。本文提出PropLLM,首次将逐跳场景重建范式与LLM的生成式推理能力相结合。从端点告警出发,PropLLM沿传播路径逐跳回溯,在每一跳从双层知识图谱(KG)中检索可验证的事实证据,同时所提出的时序因果传播注意力(TCPA)机制将已知拓扑因果先验直接编码进注意力计算,引导模型沿正确的因果方向前进,最终通过一条证据完备的因果链定位根因并判定故障类型。在真实世界的Wi-Fi多模态故障数据集上,PropLLM较最强基线将故障类型诊断准确率提升3.9%,根因定位准确率提升4.7%,同时将幻觉率降低50.8%。在TeleLogs 5G数据集上的补充实验进一步证明了所提方法在不同网络场景下的有效性。
