论文
多智能体LLM系统中浪费计算的早期诊断:失败感知可观测性
Early Diagnosis of Wasted Computation in Multi-Agent LLM Systems via Failure-Aware Observability
摘要
在最终答案评估可以解释问题所在之前,故障感知可观察性会诊断多代理 LLM 系统中的计算浪费。我们提出了一个基于跟踪的三代理架构框架——编排器、搜索代理和执行代理——将结构化事件转换为循环、预算压力、信息增益低和工具不稳定的在线信号,然后添加离线语义基础指标和选择性的大语言模型作为法官评估。在相同上限下的 165 次 GAIA 验证跟踪中,98 次运行产生了可用的最终答案,67 次运行失败或停止,没有一个。在警告失败的运行中,平均有 58.1% 的词元在第一次警告后被花费,这表明干预的机会很大。 10 个任务的 2 级试点使用警告来多样化搜索或要求证据,将警告后标记分数从基线中的 0.638 减少到 0.304。结果支持分层设计:廉价的在线信号帮助协调器重定向或停止冗余行为,而更深入的语义检查确定完成的答案是否足够可信。