论文
ClawArena-Team:语言模型智能体中子智能体编排与动态工作流的基准
ClawArena-Team: Benchmarking Subagent Orchestration and Dynamic Workflows in Language-Model Agents
摘要
生产大型语言模型(LLM)代理越来越多地被部署为管理者,而不是单独的问题解决者:主模型创建专门的子代理,委托工作,并通过动态工作流程协调其并行、异步返回。一个模型是否能够真正运行这样一个团队在很大程度上是无法衡量的:现有的基准测试对策略本身的任务解决或固定的多代理系统的紧急行为进行评分,但没有一个基准测试能够隔离作为领导者的单个大语言模型的管理能力。我们推出了 ClawArena-Team,这是一个包含 41 个多回合、多模态、多目录场景的基准,涵盖 258 轮评估和 72 次分阶段更新,用于衡量这种管理能力。主代理被故意限制:它本身仅感知文本并仅直接访问工作空间的一部分。它控制着一个固定的、本地服务的子代理池,因此分数差异反映的是管理技能,而不是原始能力。所有评分均基于执行,没有大语言模型评判:总体评分——子代理管理评分 (SMS)——将任务正确性乘以最小权限和模态路由因子。在 12 个专有、社区托管和自托管模型中,实验表明管理瓶颈是权限授予而不是感知(没有模型超过 50% 工作空间权限精度);成本和管理质量是解耦的(API 成本跨度超过 100 倍,而总体得分跨度不到 4 倍,最便宜的开放模型位于帕累托前沿);大多数排行榜分数集中在 9.9 分范围内,而编排行为的差异超过一个数量级。代码可在 https://github.com/aiming-lab/ClawArena 获取。
