论文
分而治之:多模式世界模型的解耦表示对齐
Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models
摘要
新兴的多模态世界模型试图联合生成跨不同模态(例如 RGB、深度和掩模)的视频,但它们未能充分利用现有基础模型的丰富先验。我们提出 $M^2$-REPA,这是第一个为多模态视频生成量身定制的表示对齐方法。我们的主要见解是,在不同模态空间上训练的基础模型自然会捕获不同的特定领域先验,充当互补的“专家”。具体来说,我们首先将特定于模态的特征与扩散模型的中间表示解耦,然后将每个特征与其相应的专家基础模型对齐。为此,我们设计了两个协同目标:强制特征与专家匹配的多模态表示对齐损失,以及鼓励不同模态之间互补的特定模态解耦正则化。这种设计可以实现联合优化,充分利用多个基础模型的先验知识。大量的实验表明,我们的方法在视觉质量和长期一致性方面显着优于基线。