论文
多智能体系统中自我改进的错误诊断
Towards Self-Improving Error Diagnosis in Multi-Agent Systems
摘要
基于 大语言模型 (LLM) 的多代理系统 (MAS) 可以解决复杂的问题,但会带来重大的调试挑战,其特点是长交互跟踪、代理间依赖性和延迟错误表现。现有的诊断方法通常依赖于昂贵的专家注释或“LLM-as-a-judge”范例,这些范例很难在扩展上下文中查明决定性的错误步骤。在本文中,我们介绍了 ErrorProbe,这是一种用于语义故障归因的自我改进框架,可识别负责的代理和原始错误步骤。该框架通过三阶段管道运行:(1) 操作 MAS 故障分类法以检测局部异常,(2) 执行症状驱动的向后追踪以删除不相关的上下文,(3) 采用专门的多代理团队(策略师、调查员、仲裁员)通过基于工具的执行来验证错误假设。至关重要的是,ErrorProbe 维护了经过验证的情景记忆,仅当错误模式被可执行证据确认时才会更新,而无需注释。 TracerTraj 和 Who&When 基准测试的实验表明,ErrorProbe 显着优于基线,特别是在步骤级本地化方面,而经过验证的内存无需重新训练即可实现稳健的跨域传输。