论文

重新思考多智能体系统中的失败归因:一个多视角基准与评估

Rethinking Failure Attribution in Multi-Agent Systems: A Multi-Perspective Benchmark and Evaluation

模型评测基准与评测资源

摘要

失败归因对诊断和改进多智能体系统(MAS)至关重要,但现有基准和方法大多假设每次失败只有单一确定性的根因。在实践中,由于智能体间依赖关系复杂、执行轨迹含糊,MAS失败往往存在多种合理的归因。我们从多视角的立场重新审视MAS失败归因,提出多视角失败归因——一种显式考虑归因模糊性的实用范式。为支持这一设定,我们提出MP-Bench——首个面向MAS多视角失败归因的基准,以及为该范式量身定制的新评估协议。通过大量实验,我们发现"LLM难以胜任失败归因"这一既有结论很大程度上源于现有基准设计的局限。我们的结果凸显了多视角基准与评估协议对实现现实且可靠的MAS调试的必要性。

重新思考多智能体系统中的失败归因:一个多视角基准与评估:论文配图
图 1. 说明 MAS 故障归因的多视角性质的激励示例。 (a) 展示了 MAS 的简化执行日志。 (b) 给出了确定性故障归因的示例 现有方法假设 (c) 给出了多视角故障归因的示例。