论文

看见完整执行过程:多Agent系统故障归因基准

Seeing the Whole Elephant: A Benchmark for Failure Attribution in LLM-based Multi-Agent Systems

智能体系统Agent任务评测

摘要

由于自然语言推理、不确定性输出和复杂的交互动态,故障归因(即识别故障的责任代理和决定性步骤)在基于 LLM 的多代理系统 (MAS) 中尤其具有挑战性。因此,可靠的基准对于指导和评估归因技术至关重要。然而,现有的基准测试依赖于部分可观察的跟踪,这些跟踪仅捕获代理输出,忽略了开发人员在调试时实际使用的输入和上下文。我们认为,应该在完全执行可观察性的情况下研究故障归因,并与面向开发人员的现实场景保持一致,在这些场景中,可以访问完整的跟踪(而不仅仅是输出)来进行诊断。为此,我们引入了 TraceElephant,这是一个专为故障归因而设计的基准测试,具有完整的执行跟踪和可重现的环境。然后,我们系统地评估各种配置的故障归因技术。具体来说,与部分观察对应物相比,完整跟踪可将归因准确度提高高达 76%,从而确认丢失的输入掩盖了许多失败原因。 TraceElephant 为后续故障归因研究提供了基础,促进反映真实世界调试的评估实践,并支持开发更透明的 MAS。