论文
M$^\text{4}$World:用于交互式对象操作和一分钟流媒体的多视图多模态驾驶世界模型
M$^\text{4}$World: A Multi-view Multimodal Driving World Model for Interactive Object Manipulation and Minute-long Streaming
摘要
驾驶世界生成已成为可扩展自动驾驶模拟的核心功能,但现有方法在对象级可控性和长期稳定性方面仍然有限。我们提出了 M$^\text{4}$World,这是一种多视图和多模式生成驾驶世界模型,它合成未来的环视视频流和同步 LiDAR 扫描,同时支持交互式对象操作和稳定的一分钟长流。细粒度的对象操作是通过灵活的条件接口实现的,该接口支持对单个对象的空间布局和视觉外观的显式控制。另一方面,稳定的一分钟长的流媒体是通过多阶段训练框架实现的,该框架只需四个去噪步骤即可实现在线因果生成,同时在整个扩展过程中保持连贯的世界动态。在这些组件的基础上,我们引入了高效的少剪辑 后训练 以及一套视觉参考条件生成模型,保留了一般生成能力,同时允许罕见情况下的长尾可控性定制。为了评估超越现实的可控性,我们进一步引入了基于 VLM 的自动化判断管道,用于评估场景级条件遵守情况、视图对象可控性和跨视图对象一致性。综合实验表明,M$^\text{4}$World 始终如一地提供高生成质量、精确的可控性和稳定的一分钟长的流媒体。与下游长尾增强和场景编辑相结合,这些结果证明了 M$^\text{4}$World 在可控、可扩展的驾驶模拟方面的潜力。