论文

ARGUS:基于 MCP 的 Kubernetes 事件根本原因分析

ARGUS: MCP-Grounded Root Cause Analysis for Kubernetes Incidents

应用与实践行业应用

摘要

Kubernetes 事件分类需要跨多个监控工具关联来自指标、日志、容器状态和消息系统的信号,这是一个分散的工作流程,会减慢诊断速度并导致警报疲劳。 大语言模型 (LLM) 已显示出自动化根本原因分析 (RCA) 的前景,但现有系统依赖于自定义的、特定于系统的数据访问层,无法跨组织重复使用。我们推出了 ARGUS,这是一款基于 MCP 的 RCA 助手,它通过涵盖 Kubernetes 状态、Prometheus 指标、Loki 日志和 NATS 消息传递的标准化 MCP 服务器将商业 LLM 连接到实时 Kubernetes 可观测性数据,并在值班工程师已经工作的 Slack 事件通道内提供结构化诊断摘要。我们使用三种互补方法对 ARGUS 进行初步评估:跨 10 个 Kubernetes 事件场景的受控故障注入、在三个维度上对生成的 RCA 摘要进行基于评分的评分,以及对工业合作伙伴的六名待命工程师进行半结构化访谈。 ARGUS 在所有 10 个场景中都给出了正确的根本原因,MCP 的总成功率为 0.91。从业者信任诊断结果,但始终对建议的修复表示怀疑。我们的主要发现是诊断/规定不对称:ARGUS 可靠地识别出问题所在,但在指定下一步做什么方面被认为不太可靠或不值得信赖。这种模式可以在所有三种评估方法中观察到,并且对未来的自主代理事件处理系统具有重要意义。