论文
具有表示自动编码器的多人交互世界模型
Multiplayer Interactive World Models with Representation Autoencoders
摘要
我们引入了第一个针对由复杂物理交互控制的高度动态环境的多人世界模型。单人游戏世界模型将其他智能体视为环境的一部分,而我们的条件是多个智能体的动作流,学习将场景中的变化归因于正确的玩家,并在其动作的任意组合下保持连贯。我们在《火箭联盟》游戏中研究了这个问题,玩家在快速、紧密耦合的动态下竞争和合作。我们的 50 亿参数潜在扩散模型经过使用公开机器人收集的 10,000 小时游戏玩法进行训练,可实时生成四人比赛,在单个 Nvidia B200 GPU 上每秒生成 20 帧。尽管仅在短片段上进行训练,但其轨迹展开在训练范围之外保持稳定:分布质量保持稳定至五分钟,这是我们测量的最长范围,并且在实践中,我们观察到轨迹展开持续数小时,没有崩溃的迹象。我们系统地研究了核心设计选择:视频编解码器、生成目标和多人调节方案。此外,我们还描述了行为如何随模型和数据规模而变化,包括出现的功能和持续存在的故障模式。我们进一步开发有针对性的评估,探索模型的物理理解,而不仅仅是视觉外观。为了支持多人世界模型的持续研究,我们发布了数据集、完整的训练和推理代码库以及现场演示。