论文

拓扑感知、以内存为中心的架构,将根本原因推导与根本原因解释分开

A Topology-Aware, Memory-Centric Architecture that Separates Root-Cause Derivation from Root-Cause Explanation

摘要

现代微服务部署的失败方式很容易检测但难以解释。当故障沿着服务依赖关系传播、警报泛滥、仪表板成倍增加、资源稀缺时,了解服务如何关联的工程师就需要重建监控堆栈丢弃的上下文。我们认为,自主操作中缺少的要素不是更好的异常检测器或更大的语言模型,而是操作记忆:系统正常行为方式、其各部分如何相互依赖以及以前如何失败的持久、结构化表示。我们提出了 O PS C ORTEX,这是一个有效的多智能体原型,它将这种记忆组织成四层,并用它来分离该领域通常混淆的两个任务:推导根本原因并解释它。根据学习的依赖图和阈值交叉的时间顺序确定性地计算根本原因;然后,仅要求 大语言模型 (LLM) 使用系统已经收集的证据进行解释、确认和推荐。我们通过两个记录的生产级联故障来激励设计,回顾有关可观察性、异常检测、基于图形的定位和 LLM 辅助诊断的代表性文献,并展示每个架构选择如何直接映射到这些事件所表现出的故障模式。该原型在具有八个可注入故障场景的仪器化电子商务基准上进行了验证。