论文

从一般代理到 RCA 专家:用于根本原因分析的自我进化工具

From General Agents to RCA Experts: A Self-Evolving Harness for Root Cause Analysis

智能体系统Agent Harness

摘要

使用 大语言模型 (LLM) 进行自动根本原因分析 (RCA) 引起了越来越多的关注。如今,SRE 通常通过以下两种方式之一使用 LLM 实现 RCA 自动化:直接使用通用代理(例如 Codex 或 Claude Code)进行诊断,或者从头开始构建专门的 RCA 代理。随着主流总代理能力的增强和快速迭代,我们的定量研究发现前者现在常常超越后者。然而,其准确性仍然达不到生产需求,而这种差距主要源于智能体一般能力之外的外部适应层,即harness。因此,我们认为基于 LLM 的 RCA 应该专注于这种外部工具,重用现代代理强大的通用功能,而不是从头开始重建代理。这种Harness的一个关键功能是自我进化,从过去的诊断中积累系统特定的经验,以便使用得越多,它就会变得越好。我们推出 OpsHarness,这是一种自我进化的 RCA Harness,可将诊断经验转化为可重复使用的专业知识。其数据平面将分层操作知识与想法卡工具库相结合,而其控制平面则协调设置、诊断、演进和验证。在进化过程中,OpsHarness 会对比成功和失败的轨迹,将其证据转换为原子提案,并仅通过旨在防止过度拟合和回归的双门验证过程才允许更新。在两个公共基准和工业部署中,OpsHarness 实现了 59.0\% 的 top-1 准确率,比裸一般代理提高了 63.4\%,比基线 RCA 代理提高了 4.02$\times$。