论文

StepFinder:多智能体失败归因的时序语义框架

StepFinder: A Temporal Semantic Framework for Failure Attribution in Multi-Agent Systems

AI 基础设施可观测性

摘要

基于LLM的多智能体系统在复杂的多步骤任务中表现出卓越的协作能力。然而,这些系统对单步执行错误高度敏感,这些错误可能通过代理交互传播并导致级联故障。为了了解故障原因并提高系统可靠性,引入了故障归因作为一项任务,旨在自动识别导致故障的根本原因步骤。现有的故障归因方法主要依靠LLM对原始执行轨迹进行推理,这不仅会带来较高的推理成本和延迟,而且还会受到冗余和噪声执行日志的干扰,导致LLM难以准确识别真正的根本原因步骤。为了解决这个问题,我们提出了 StepFinder,一个轻量级的故障归因框架。我们仅在特征构建阶段使用 LLM 将执行日志编码为时间语义序列。随后,应用时间建模和注意力模块的参数有效组合来捕获轨迹的顺序演化和跨步骤依赖性。最后,通过多尺度差异和位置偏差细化步骤级错误分数,从而实现精确的根本原因识别。 Who&When 基准测试的实验结果表明,StepFinder 在步骤级故障归因方面优于基于 LLM 的方法,同时实现了更高的推理效率,与最快的基于 LLM 的方法相比,推理时间减少了 79%,并且没有文本生成开销。我们的代码可在 https://github.com/taiyu-zhu/StepFinder 获取。

StepFinder:多智能体失败归因的时序语义框架:论文配图
图 1. MAS 故障归因概述和方法比较。该图说明了 MAS 中的诊断工作流程,并提供了现有方法和我们提出的模型之间的多维比较。简介。