论文

先检测,再归因:多智能体系统中的级联失败归因

Detect Before You Attribute: Cascade Failure Attribution for Multi-Agent Systems

AI 基础设施可观测性

摘要

基于大语言模型(LLM)的代理在通过多步骤推理解决复杂任务方面表现出了强大的潜力,但它们仍然容易受到执行失败的影响。因此,准确的故障归因对于提高代理可靠性至关重要。现有的基于拓扑和谱的方法利用轨迹结构,但常常忽略细粒度语义,而基于 LLM 的归因方法捕获语义线索,但会因长轨迹而遭受长上下文退化。为了应对这些挑战,我们提出了 DUOTRACE,这是一种用于基于 LLM 的故障归因的即插即用检测过滤器。 DUOTRACE 遵循先检测后属性的范例:它首先检测异常执行,然后向下游基于 LLM 的归因方法提供重点轨迹证据。为了对代理轨迹进行有效的基于 VAE 的异常检测,DUOTRACE 集成了双视图语义结构节点表示、基于 Tree-LSTM 的轨迹编码器以及基于前缀链和 LLM 的数据增强,以处理异构节点、分层执行结构和有限的故障数据。对六个基于 LLM 的归因基线的实验表明,DUOTRACE 将代理级别和步骤级别的归因准确度分别提高了 8.7% 和 7.0%。

先检测,再归因:多智能体系统中的级联失败归因:论文配图
图2 DuoTrace的总体结构。