论文
重新思考多智能体系统中的失败归因:一个多视角基准与评估
Rethinking Failure Attribution in Multi-Agent Systems: A Multi-Perspective Benchmark and Evaluation
摘要
失败归因对诊断和改进多智能体系统(MAS)至关重要,但现有基准和方法大多假设每次失败只有单一确定性的根因。在实践中,由于智能体间依赖关系复杂、执行轨迹含糊,MAS失败往往存在多种合理的归因。我们从多视角的立场重新审视MAS失败归因,提出多视角失败归因——一种显式考虑归因模糊性的实用范式。为支持这一设定,我们提出MP-Bench——首个面向MAS多视角失败归因的基准,以及为该范式量身定制的新评估协议。通过大量实验,我们发现"LLM难以胜任失败归因"这一既有结论很大程度上源于现有基准设计的局限。我们的结果凸显了多视角基准与评估协议对实现现实且可靠的MAS调试的必要性。
