论文

verifyMAS:LLM 多代理系统中故障归因的假设验证

VerifyMAS: Hypothesis Verification for Failure Attribution in LLM Multi-Agent Systems

智能体系统Agent任务评测

摘要

大语言模型驱动的多代理系统(LLM-MAS)擅长复杂任务,但不可靠的代理仍然是系统级可靠性的关键瓶颈。因此,自动故障归因至关重要,但现有方法(例如直接预测代理错误对和代理优先故障归因)依赖于代理的本地日志,并且错过了仅在完整交互轨迹上显现的全局故障,例如跨步骤不一致和代理间协调错误。此外,直接预测故障会产生很大的组合搜索空间,阻碍细粒度的归因。为了应对这些挑战,我们提出了VerifyMAS,一个用于代理故障归因的假设验证框架。 verifyMAS 不是直接预测故障代理和错误类型,而是根据完整轨迹制定和验证故障假设。这种基于验证的方法将归因分解为轨迹级错误验证和细粒度代理定位,提供了一种错误优先的归因方法,可以捕获全局故障模式,同时大大减少搜索空间。我们进一步引入了一种基于结构化错误分类的基于假设的数据构建策略,并微调了专门的 LLM 验证器模型,用于轨迹级故障验证和代理归因。在 Aegis-Bench 和 Who&When 上的实验表明,VerifyMAS 持续改进了各种骨干模型,包括开源 Qwen 和基于 API 的 GPT 模型,在不牺牲长多智能体轨迹的推理效率的情况下优于先前的方法。