论文
MV-Forcing:通过 4D几何约束时空自强迫生成长多视图视频
MV-Forcing: Long Multi-View Video Generation via 4D-Grounded Spatio-Temporal Self-Forcing
摘要
视频扩散模型的最新进展已经实现了通过时间自回归的长单视图生成,或通过双向注意力的短多视图合成。然而,生成动态场景的长的、多视图一致的视频仍然没有解决。在这项工作中,我们提出了 MV-Forcing,这是一个框架,通过在顺序生成的视图之间引入 4D 几何桥,在单个扩散模型中组合时间和视图方面的自回归。我们的主要见解是,自回归 3D 重建模型自然地在自回归生成的视图之间进行交互。给定完整的源视图,我们重建其 3D 结构并渲染下一个目标视点的几何先验,扩散模型将其细化为高质量视频。为了将生成扩展到教师的固定时间窗口之外,我们引入了联合去噪机制,其中两个视图槽在训练期间从噪声中初始化,从而实现时间无界生成。我们通过具有时空自强迫的分布匹配 蒸馏 来提炼模型,从而缩小了时间和视图顺序自回归的训练推理暴露偏差差距。对合成数据和真实世界数据的大量实验表明,MV-Forcing 使用单个几步学生模型可以生成任意长度和视点计数的动态场景的几何一致的多视图视频。