论文

DCFA:基于双视角因果启发的LLM多智能体系统故障归因方法

DCFA: Dual-view Causal-inspired Attribution for Failure Reasoning in LLM-based Multi-agent Systems

AI 基础设施可观测性

摘要

基于大语言模型(LLM)的多智能体系统近年来发展迅速,但系统仍易出现推理与协调错误,导致系统级故障。故障归因依赖于追踪智能体间的自然语言交互,以识别决定性错误,即最早一个动作的修正可逆转系统故障。现有方法面临两个关键挑战:1)浅层归因:现有方法通常仅捕捉微小偏差,如检索不完整或格式错误,此类错误可通过验证机制修复,却未能识别系统故障的根本原因;2)上下文退化:随着系统轨迹长度增加,模型的推理能力迅速下降。为解决上述问题,我们提出DCFA,一种无需训练的故障归因框架。DCFA整合全局模块,从系统轨迹中构建结构化的因果启发依赖图,以识别初始决定性错误;并引入局部模块,通过局部反事实启发的推理来优化因果启发的归因结果。在Who&When基准中,针对六种LLM的实验表明,DCFA在步骤级准确率上较现有最佳基线提升最高8.27%。

DCFA:基于双视角因果启发的LLM多智能体系统故障归因方法:论文配图
图 1:基于 LLM 的多智能体系统中的故障归因图示。系统跟踪表示为由智能体生成的交互消息组成的文本记录。