论文
AgentWorld:长程非对称多智能体协作基准
AgentWorld: Benchmarking Long-Horizon Collaboration of Multi-agent LLMs
摘要
现有的多智能体基准测试主要在竞争环境、20 个步骤以下的短期交互中进行测试,或者只是简单地汇总个体性能,无法隔离和突出基于 LLM 的智能体的真正协作能力。我们引入了 AgentWorld,这是一个包含 100 个人工注释任务(具有 100 个增强变体)的基准,用于评估长期、多智能体协作。任务跨越丰富的 MMORPG 沙箱进行 50 多轮交互,需要 3-20 个角色和能力不对称的智能体在黑盒设置下通过通信、联合规划和资源共享进行协调,其中每个智能体独立行动,无法访问其他智能体的内部状态。除了传统的二元任务成功之外,为了量化协作有效性,我们提出了因果协作有效性(CCE),这是一种基于图形的指标,可跟踪代理操作之间的因果依赖关系,并衡量团队工作的哪一部分实际上对结果做出了贡献。使用 Gemini 3 Flash、Claude Haiku 4.5、GPT-5 Mini 和 DeepSeek R1-70B 进行的实验表明,即使是最好的模型也只能实现 52.0% 的任务成功率,并出现系统性故障模式,包括通信故障、角色混乱以及无法跨轮维护共享计划。 AgentWorld 是完全开源的。
