论文

超越基于 LLM 的推理:用于代理故障归因的轻量级 GNN

Beyond LLM-Based Reasoning: Lightweight GNNs for Agent Failure Attribution

智能体系统Agent任务评测

摘要

基于 大语言模型 (LLM) 的多代理系统 (MAS) 通常表现出复杂的故障模式,这经常导致代理产生错误的结果。这激发了智能体故障归因的任务:给定一个失败的多智能体轨迹,识别有故障的智能体及其相应的错误类型。现有方法主要依靠 LLM 来执行故障归因,无论是通过直接提示、微调 对合成数据还是复杂的代理管道。虽然有效,但由于长上下文处理、昂贵的 后训练 和手工制作的工作流程,这些方法会产生大量的计算开销。此外,经验证据表明,即使是最先进的模型在现有基准上的准确性也有限,这表明仅扩展模型大小是不够的。在这项工作中,我们重新审视这项任务,并质疑这种昂贵的生成解决方案的必要性。我们引入了 AFANet,这是一个基于图的轻量级框架,它通过步骤级语义信号和代理级关系对交互轨迹进行建模。我们表明,凭借显着更少的参数和接近于零的推理成本,AFANet (i) 匹配或优于基于 LLM 的基线,包括在域内基准上微调的模型,(ii) 在不同的 GNN 架构中保持稳健的性能,(iii) 可以通过 OOD 基准上廉价的测试时间适应来进一步改进。我们的结果表明,有效的代理失败归因不需要繁重的 LLM 推理,轻量级的结构化方法可以实现强大的性能。