论文
MASBench:部分可观测性下基于LLM的多智能体协作的基准测试
MASBench: Benchmarking LLM-based Multi-Agent Collaboration under Partial Observability
摘要
大语言模型(LLM)已逐步演变成自主智能体的核心。在此进展的基础上,基于LLM的多智能体系统 (MAS) 将多个智能体协调成一个协同团队,以完成超出单个智能体能力的复杂任务。此类系统的有效性不仅取决于智能体本身,还取决于协作机制的设计和组织方式。请注意,现实世界的协作通常是部分可观察的,由于物理或隐私相关的限制,每个智能体只能访问有关环境的部分信息。然而,许多现有的多智能体基准测试假设全局可观察性,并且对系统评估协作机制的支持有限。为了弥补这一差距,我们引入了 MASBench,这是一个在部分可观察约束下设计的多智能体协作基准测试。它分为三个渐进的任务类别:推理、调度和游戏。通过这个结构,我们逐步评估三种代表性的协作机制:协议、记忆和路由。 MASBench 进一步提供确定性评估指标,包括性能评分、通信成本和成本效益,以表征协作结果和通信开销。不同LLM、骨干模型和机构配置的实验为有效的 MAS 设计提供了经验指导。代码可在以下位置获取:https://github.com/BUPT-GAMMA/MASBench
