论文
Emergence World:长程多Agent自治评测平台
Emergence World: A Platform for Evaluating Long-Horizon Multi-Agent Autonomy
摘要
LLM 代理的大多数评估看起来都像考试:离散任务、干净的环境、几分钟或几小时内的分数。我们认为,这种方法与自主系统的部署条件不匹配,其中相关的时间尺度可能是几周到几个月,而且最重要的动态,例如行为漂移、不同环境背景下的治理以及来自不同模型系列的代理之间的交叉影响,只会随着时间的推移而出现。我们推出了 Emergence World,这是一个连续运行的多智能体模拟平台,旨在使这些动态可测量。该平台在基于实时外部数据(例如实时天气、新闻 API、互联网访问)的共享空间世界中托管 LLM 驱动的代理群体,为每个代理配备 120 多个专用工具和三个持久记忆系统,并让他们通过民主机制进行自我管理,并产生相应的结果。该平台在推理层与模型无关,并支持异构群体,其中来自不同供应商的代理共享同一个世界。为了说明该平台可以处理的问题类型,我们提出了一项为期 15 天的跨供应商研究,涉及由 Claude Sonnet 4.6、Grok 4.1 Fast、Gemini 3 Flash、GPT-5-mini 和混合群体提供支持的五个平行世界。相同的角色和起始条件产生了截然不同的结果,从稳定的协商治理到Agent群体全部崩溃。我们发布提示、日志数据和配置,以支持长期多智能体自治的进一步研究。