论文
EMFA:用错误传播与反事实验证定位多Agent失败根因
Error-Propagation Modeling for Failure Attribution in LLM-Based Multi-Agent Systems
摘要
基于 LLM 的多智能体系统 (MAS) 越来越多地用于通过协调推理、工具使用以及与外部资源的交互来解决复杂任务。然而,归因此类系统中的故障仍然具有挑战性,因为观察到的结果通常不会直接揭示导致执行失败的错误。在这项工作中,归因目标是决定性错误,定义为代理-步骤对,其纠正将恢复失败的执行。现有方法在很大程度上识别可疑步骤,而没有明确建模错误如何在交互中传播或持续存在于未解决的循环中,从而难以将决定性错误与下游故障症状区分开来。我们提出对 \textbf{F}ailure \textbf{A}ttribution (\textbf{EMFA}) 进行 \textbf{E}rror-Propagation \textbf{M} 建模。 EMFA 构建失败轨迹的结构化表示,对级联传播和持久交互循环进行建模,并使用传播感知候选者筛选,然后进行反事实验证来识别决定性代理 - 步骤 一对。在 Who\&When 基准上,EMFA 实现了最先进的阶梯级归因准确性,并在代理级别保持竞争力。它在手工制作和算法生成的子集上分别将之前的最佳步级结果提高了 3.45 个百分点和 4.40 个百分点。