MAADBench:多Agent系统中异常检测的可刷新范式
MAADBench: The Refreshable Paradigm for Anomaly Detection in Multi-Agent Systems
摘要
最近的研究报告称,基于 LLM 的多Agent系统 (MAS) 的失败率为 41%-87%,但据我们所知,迄今为止还没有基准支持它们的系统异常检测 (AD)。构建 MAS AD 基准很困难,因为它们必须随着 LLM 系统的发展而保持新鲜:任务可能会泄漏到训练数据中,从而被 LLM 记住,跟踪和异常模式会随着骨干网的发展而过期,并且必须为每次刷新提供可靠的标签。为了应对这些挑战,我们推出了 MAADBench(MA:多Agent;AD:异常检测),这是第一个可更新的 MAS AD 基准,专为Agent底层的多样化、不断发展的 LLM 主干而设计。 MAADBench 结合了 (1) 在大约 10^37 任务空间上的采样和耦合生成任务,以减少任务泄漏,(2) 在可配置的 LLM 主干下生成可刷新的跟踪,以及 (3) 自动提供免费的、确定性的步骤级标签,以进行细粒度的 AD 评估。除了提供范例本身之外,我们还运行具有五个最先进的 LLM 主干的 MAADBench,并发布了包含 5,200 个步骤标记轨迹的 MAADBench-Full 数据集。在 MAADBench 数据集上对 25 种 AD 方法进行基准测试揭示了当前方法的重大局限性:它们严重依赖监督,与微妙的 MAS 特定异常作斗争,并且缺乏跨 LLM 主干的鲁棒性。这些差距指向 MAS 特定异常检测的丰富研究议程,MAADBench 为方法开发和评估提供了系统且可更新的测试平台。我们在 https://huggingface.co/datasets/hww123/MAADBench-full. 开源 MAADBench-Full