论文

Full-4D:从单视图视频生成全范围 4D 场景

Full-4D: Generating Full-Scope 4D Scenes from a Single-View Video

模型架构Transformer

摘要

从单视图视频生成 4D 场景本质上是不恰当的:单个视点缺乏恢复完整的动态场景所需的信息。现有方法通常仅限于单目视频、简单的 3D 效果或原始视点周围的小视点扰动,无法实现真正​​的 4D 生成。与此同时,缺乏使用同步多视图视频捕获全范围 4D 场景的大规模数据集,进一步阻碍了这一方向的进展。我们提出了一种新颖的单视图视频到 4D 框架,该框架将全范围 4D 生成转换为多视图视频合成,然后根据生成的视图进行基于优化的 4D 重建。为了端到端地实例化这个公式,我们做出了三个关键贡献。首先,我们介绍 Real-MV-4D,这是一个在不同现实环境中捕获的同步多视图视频的大规模数据集,用于提供 4D 监督。其次,我们训练了一个由新颖的融合时间(T)-视图(V)注意机制驱动的多视图视频扩散模型,该机制直接将几何重投影先验和显式相机条件嵌入到其视图时间交互中。与基本特征融合不同,这种直接绑定将生成过程与物理 3D 先验严格对齐,以生成密集、同步的 T$\times $V 视频网格。第三,我们不依赖非交互式且不一致的 2D 视频插值,而是将合成的多视图视频提升为显式 4D 表示(即 4DGS),并通过流匹配 蒸馏 损失进行正则化,该损失在改进新颖视图渲染之前利用多视图。大量实验表明,我们的方法在视觉保真度和几何一致性方面均优于现有方法,能够从单视图视频生成全范围 4D 场景。