论文

CoCoBench:具体多智能体任务规划的协作协调基准

CoCoBench: A Cooperative Coordination Benchmark for Embodied Multi-Agent Task Planning

智能体系统Agent任务评测

摘要

近年来,由多模式 大语言模型 (MLLM) 支持的代理系统发展迅速,但现有的具体代理基准仍然缺乏针对多代理协调的细粒度诊断。大多数基准测试要么关注单智能体任务完成情况,要么总结多智能体行为与总体任务成功率,这可能会掩盖协调失败,例如重复工作、违反排序约束、资源争用和不同步切换。在本文中,我们介绍了 CoCoBench,这是一个用于评估可执行家庭任务中多智能体体现协调的构造级基准。 CoCoBench 包含 897 个经过 Oracle 验证的实例,围绕四个重复的协调结构组织:任务分配、顺序排序、互斥和切换协调。除了任务成功率之外,CoCoBench 还提供构建级分数来衡量代理是否有效协调。我们评估了 11 个领先的 MLLM,涉及不同的协调模式、观察输入和代理数量。结果表明,协调能力具有高度的结构特异性:强大的整体绩效并不意味着不同协调类型之间的能力平衡。这些发现为设计有针对性的模型架构和提高多智能体协调能力指明了新方向。