论文

OrchestraBench:评估多Agent编排的失效模式、恢复与分解质量

OrchestraBench: Evaluating Multi-Agent Orchestration Failure Modes, Recovery, and Decomposition Quality

智能体系统Agent HarnessAgent任务评测

摘要

多代理协调框架从演示阶段转向生产环境,但基准测试通常报告任务准确度,而不诊断失败管道、失败点或路由决策导致的崩溃。OrchestraBench通过模板化的企业工作流进行控制和可重复失败注入,评估失败、恢复和分解。它引入了链长度和故障模式下的恢复作为主要指标,并将路由策略与基于置信区间和配对测试的基准比较。在26个金标签诊断案例中,关键词/标志路由器在误导性或缺失表面标志的情况下得分0%,而意图推理模型路由器则达到100%,匹配了oracle。通过验证的算术依赖链上的实际Claude代理进行控制机制探查,揭示了五个MAST模式中的三个失败处理层级:工具故障完全恢复(1.0),模棱两可的委托部分恢复(0.30),而三个潜在或语义模式从未恢复(0.0)。当计算重新定义为贷款批准流程时,这些结果在Sonnet、Opus和Haiku中保持不变,尽管绝对率随上下文变化。盲重试揭示了潜在故障,并增加了检测时间,表明检测和归属是必要的以实现隔离。链长度随着管道深度增加(平均0.9到4.7,范围3-7)。可信状态修复的消融实验显示,似乎的隔离主要来自可信状态信号而非自主检测。这些结果是控制链机制探查,而不是领域工作负载声称。