论文

语言智能体中开放式多智能体协调的基准测试

Benchmarking Open-Ended Multi-Agent Coordination in Language Agents

智能体系统上下文与知识记忆Agent任务评测Agent记忆长程任务评测

摘要

随着语言模型越来越多地被部署为自主代理,它们必须在开放式交互任务中长期与其他人协调。然而现有的评估很少一起测试这些需求,而是强调单智能体任务、短交互或高度结构化的多智能体设置。我们引入了 $alem$,这是一个基于 JAX 的基准,用于基于 Craftax 类动态构建的开放式多智能体协调。阿莱姆将程序生成的协调任务、软专业化、沟通和可控协调难度嵌入到一个充满探索、制作、贸易和战斗的长视生存世界中。我们以训练有素的 MARL 代理作为参考点,在同质团队中对 13的现代大语言模型进行零样本评估。目前的 LLM Agent距离解决问题还很远,平均标准化回报率仅为 6%,但他们的失败并不均匀。在最难的协调设置上,零样本 Gemini-3.1-Pro-High 接近经过 10 亿步训练的 MARL 代理,而 GPT-5.4-High 实现了强大的基本任务奖励,但协调奖励要低得多。这种对比表明,个人任务能力并不意味着协调能力。消融表明,沟通是协调的最大贡献者,而记忆和推理在用于维护多步骤计划时很有帮助。总的来说,我们的结果表明,协调是前沿大语言模型Agent的一个明显瓶颈,与单一Agent的能力不同。 Alem 使这个瓶颈变得可测量,并为开发代理提供一个受控的测试平台,用于通信、分配角色和执行共享计划。代码可在 https://github.com/alem-world/alem-env 获取。

语言智能体中开放式多智能体协调的基准测试:论文配图
图 1:alem 将类似 Craftax 的开放世界 [37, 40] 扩展为可控的多智能体协调基准。顶部:通过采样协调任务按程序生成的关卡(∙\bullet 2-agent 同步、■\blacksquare 全代理同步、⧫\blacklozenge handover)。底部:协调采矿、建造、战斗和制作示例。通过对每个情节的任务和协调结构进行重新采样,alem 评估智能体从观察中推断协调需求的能力,而不是记住固定的任务模式。