论文
Prisma-World:摄像机控制的多智能体视频世界模型
Prisma-World: Camera-Controllable Multi-Agent Video World Model
摘要
视频世界模型在生成可控视觉体验方面取得了快速进展,但大多数模型仍然模拟单个观察者的世界。将此类模型扩展到多个代理提出了一个核心挑战:如果每个代理的未来状态是独立生成的,重叠视图可能会实例化同一场景的不同版本,从而导致代理之间的对象、布局和外观不一致。传统的相机调节控制单独的轨迹,但它没有明确耦合在共享场景几何下应一致的视图的生成。我们介绍了 Prisma-World,这是一种摄像机可控的多智能体世界模型,它将多智能体生成制定为联合几何感知去噪过程,以实现跨视图一致性。 Prisma-World 在一个全注意力序列中处理所有智能体视频,使用多智能体 RoPE 设计来区分智能体身份,同时保留同步时间坐标,并将相对摄像机几何结构注入注意力,以将重叠视点偏向共享场景证据。为了进一步加强多视图一致性并增强全球空间感知,我们通过重叠衰减课程训练范式以及小地图条件结构指导来增强我们的框架。为了促进多智能体模型的训练和评估,我们引入了 PrismaDataset,这是一个大型 UE5 数据集,具有跨不同场景的全景采集、具有灵活智能体数量和复杂相机轨迹的可组合多智能体视图组,以及用于一致性训练和评估的精确相机/动作注释。实验表明,单个 Prisma-World 模型可以生成高保真多智能体视频,具有灵活的智能体数量、摄像机可控性、改进的跨视图一致性以及小地图引导下的空间空间定位。