论文
OrchBench:通过确定性仿真隔离评估多智能体编排方案
OrchBench: Evaluating Multi-Agent Orchestration Plans in Isolation via Deterministic Simulation
摘要
复杂任务常被分解为可并行却相互依赖的子任务,这使编排对多智能体系统(MAS)的性能至关重要。现有评估通常依赖端到端执行,这把编排方案质量与工作者能力、工具可靠性及环境噪声混在一起。此外,真实执行的时间与token成本随工作流规模快速增长,使系统性评估代价高昂。我们提出OrchBench,一个基于仿真的基准,用于隔离评估多智能体编排方案。OrchBench从真实世界任务出发,构建编码任务依赖的有向无环图(DAG),并控制其规模与并行度。给定一个DAG、每智能体上下文限制与智能体预算,被评估的规划器将子任务分配给各智能体,并指定跨智能体信息传递及其保留比例。一个确定性仿真器在不调用工作者智能体的情况下评估所得方案,返回可解释的结果质量、完工时间与token成本度量。OrchBench产生的仿真分数与Claude Code执行的质量分数高度相关,Pearson相关系数达 \(r=0.816\),同时只需 \(1.3\%\) 的token与 \(10.3\%\) 的墙钟时间。在不同规划器与工作流规模上,我们发现保留任务关键信息比单纯增加智能体数量更重要,且随着协调失败的累积,并行的收益递减。这些结果确立OrchBench作为一个高效、可解释的基准,可用于比较与诊断多智能体编排方案。
