论文
修复还是重采样?重新思考大语言模型多智能体系统中的失败调试
Repair or Resample? Rethinking Failure Debugging in LLM Multi-Agent Systems
摘要
随着基于大语言模型(LLM)的多智能体系统(MAS)日益应用于长程复杂任务,其可靠性已成为阻碍其真实落地部署的核心瓶颈。现有MAS调试与修复方法通常依赖重跑和重采样整个执行轨迹。然而,一个根本问题尚待回答:这些方法是对MAS失败进行了因果性修复,还是仅仅利用LLM采样的随机性进行了随机性修复?为评估MAS修复方法的有效性,我们提出SymTrace,一个记录MAS执行轨迹并建立干预锚点的受控评估框架。在回放时,它利用记录的日志高效重构锚点之前的执行,仅重新生成下游轨迹,从而可靠地复现MAS失败。我们进一步构建数据集SymFail,包含536条经人工标注、带图关联位置、类别与轨迹证据的失败轨迹。在此基础上,我们在三个主流MAS框架上开展了大规模实证研究。我们的发现揭示,现有无引导重跑方法高度不可靠,失败复现率与修复率都很低(分别仅为67.97%与6.90%)。基于这些发现,我们进一步探索了症状驱动干预方法的有效性,它成功修复了20.15%的失败案例(相比最先进修复方法提升191.89%)。本研究旨在为MAS调试与修复研究提供可操作的洞见,为多智能体系统的稳健部署铺平道路。