论文

TopoEvo:面向微服务根因分析的拓扑感知自进化多智能体框架

TopoEvo: A Topology-Aware Self-Evolving Multi-Agent Framework for Root Cause Analysis in Microservices

智能体系统上下文与知识记忆Agent 架构与控制循环Agent HarnessAgent记忆

摘要

微服务中的根因分析(RCA)之所以困难,原因在于:(i) 噪声大且异构的多模态可观测性数据(指标、日志、追踪),(ii) 放大下游症状的级联故障传播,以及 (iii) 由自动扩缩容和滚动更新引发的非平稳拓扑漂移。近期的基于LLM的RCA智能体能够生成有工具依据的解释,但它们往往不感知拓扑,并受症状放大偏差困扰,将根因错误归因于显眼的下游受害者。我们提出TopoEvo,一个拓扑感知的自进化多智能体框架,它将图表示学习与结构化的拓扑约束推理相结合。TopoEvo首先引入度量正交多模态对齐(MOMA),将指标嵌入分解为互补子空间,并通过对比学习对齐日志与追踪,以降低模态冗余与稀疏性,为图编码生成稳定的节点表示。随后,它应用向量量化(VQ)将拓扑增强的状态离散化为可审计的症状token,并配备症状词表,从而实现可靠的检索与token级证据落地。在这些离散拓扑线索之上,TopoEvo执行多智能体的“假设—证据—检验”(HET)工作流,显式验证传播一致的解释,并将起始异常与被放大的下游症状区分开来。最后,自进化机制刷新分层故障记忆,并利用高置信度伪标签执行保守的测试时自适应,以在漂移下保持鲁棒性。

TopoEvo:面向微服务根因分析的拓扑感知自进化多智能体框架:论文配图
图1:症状放大偏差示意:多智能体拓扑感知自进化中典型信号被放大、稀有信号被淹没。