论文

MetaWorld:从单视图视频数据扩展多智能体视频世界模型

MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data

模型架构Transformer

摘要

视频世界模型是体现人工智能和元宇宙的基础生成技术,但现有方法本质上仅限于单个代理从单一角度进行观察。将这些模型扩展到多智能体设置会带来两个关键挑战:数据稀缺(对于一般开放域场景来说,协调的多视图记录的收集成本极其昂贵)和世界状态对齐(独立生成的视频流无法确保共享的物理环境和事件在不同视图之间一致地演变)。为了应对这些挑战,我们提出了 MetaWorld,这是一种新颖的框架,可以直接从单视图视频将多智能体视频世界模型扩展到开放域环境。首先,我们引入单目世界状态展开(MWSU),将单目镜头明确分解为摄像机操作员的自我运动和可见主体的空间轨迹。这种摄像机轨迹分解自然地提取共享 3D 空间内同步的多智能体运动数据,完全绕过了多摄像机设置的需要。其次,为了精确的视觉控制,我们开发了主题感知世界生成器,以实现以每个代理身份图像为条件的外观驱动模拟。最后,为了确保两种视图都基于相同的物理现实,我们提出了世界状态对齐,这是一种插入到视频 DiT 的每个 Transformer 层的每帧分支间交叉注意机制。通过联合同步去噪过程,WSA 强制执行静态几何一致性和动态运动一致性,从而鼓励共享的 3D 环境和物理事件在两种以自我为中心的视图中保持良好的一致性。大量实验表明,MetaWorld 实现了卓越的跨视图一致性和身份保真度,为多智能体视频世界建模建立了高度可扩展、物理驱动的范例。