论文

EmCoop:LLM智能体之间具体合作的框架和基准

EmCoop: A Framework and Benchmark for Embodied Cooperation Among LLM Agents

智能体系统Agent任务评测

摘要

现实场景越来越需要多个实体代理在实体约束下的动态环境中进行协作,因为许多任务超出了任何单个代理的能力。大语言模型 (LLM) 的最新进展通过推理、规划和自然语言交流实现了高级认知协调。然而,利用现有的基准很难对这种协作如何在具体多智能体系统中出现、展开以及如何促进任务成功进行细粒度的分析。在本文中,我们介绍了 EmCoop,一个用于研究基于 LLM 的体现多智能体系统中的合作的基准框架。我们的框架将高级认知层与低级体现交互层分开,使我们能够通过代理随时间的交错动态来表征代理合作。给定合作约束的具体任务,我们提出了可概括的流程级指标,用于诊断协作质量和失败模式,超越最终任务的成功。我们在两个具体环境中实例化我们的框架,这两个环境可扩展到任意数量的代理并支持不同的通信拓扑,并使用这些实例化来演示 EmCoop 如何实现跨团队规模和任务设置的合作动态的系统分析。该项目网页位于:https://happyeureka.github.io/emcoop。

COOP²:定义、观测与修复LLM多智能体系统中的协作
图1:EmCoop 概览。(1) 智能体通过双层接口运行,该接口衔接高层规划(认知层 Cognitive Layer)与低层执行(原语层 Primitive Layer)(见第 4.1 节)。(2) 我们在基准(见第 6 节)中实例化可泛化的任务设计(见第 4.2 节),该基准包含两个具身环境(MA-CRAFTER 与 CUBE)以及多样化的协作任务。(3) 在多智能体环境交互回路(Multi-Agent Environment Interaction Loop, MAEIL)中,智能体在第 I 层异步地制定计划并进行通信,原语动作的执行由第 II 层处理。(4) 通过 (1)、(2) 与 (3),我们借助协作指标使协作可观测、可量化,从而支持对协作动态的系统性分析(见第 5 节)。