论文

基于证据推理的智能体根因分析

Agentic Root Cause Analysis through Evidence-Grounded Reasoning

智能体系统Agent 架构与控制循环

摘要

诊断异常的根本原因对工业安全生产至关重要。尽管传感器部署已十分广泛,假设的形成与证据的收集仍是一个手动过程,构成主要的运维瓶颈。虽然现有数据驱动方法旨在将其自动化,但两个关键限制制约了它们的部署:它们以黑箱方式运行、无法为其诊断提供依据,并且需要稀缺的故障运行标注样本。为填补这一空白,我们提出 AgentRCA,一个用于基于证据的根因分析的零样本智能体框架。AgentRCA 不学习特定故障的映射,而是将数据驱动的数字孪生(建模正常系统动态)与工具增强的大语言模型相结合,在推理时进行推理。该智能体迭代地收集统计证据、评估相互竞争的假设,并识别最能解释观测行为的物理故障。在真实多相流实验装置和大型化工厂上的评估显示,AgentRCA 无需依赖故障特定训练即可取得与全监督基线相当的诊断性能。关键在于,它生成透明的推理轨迹,将观测到的症状与其底层物理原因显式关联。这些结果确立了自主假设驱动推理作为可扩展工业根因分析的实用基础。

基于证据推理的智能体根因分析:论文配图
图 1:AgentRCA 的架构概述。 (A) AgentRCA 仅从正常操作数据中学习数据驱动的数字孪生。正常窗口按系统设定点 (ω1,ω2,…\omega_{1},\omega_{2},\dots) 定义的操作机制进行分组。这些机制用于预先计算特定条件的统计摘要(意味着 𝝁\boldsymbol{\mu}、标准差 𝝈\boldsymbol{\sigma}、相关矩阵 𝐑\mathbf{R},...)。同时,全局自动编码器 fθf_{\theta} 在所有状态下进行训练,以学习非线性系统动力学。 (B) 数字孪生公开了模块化诊断工具,为代理提供可解释的证据,包括自动编码器残差分数、均值和方差移位、相关性差异和可选的文档检索。 (C) 在推理时,工具增强的 LLM 代理接收测试窗口和自然语言故障描述。它迭代地查询诊断工具,更新候选假设,并返回带有支持证据的排名诊断。正常运行作为可能的诊断包括在内,从而实现异常检测和根本原因分析。