论文
Ground4D:单目视频的一致性感知 4D 重建
Ground4D: Consistency-Aware 4D Reconstruction from Monocular Video
摘要
从单个单目视频中学习 4D 场景表示,支持动态小说视图合成,同时随着时间的推移保持忠实的几何形状仍然具有挑战性。动态高斯泼溅通过光度优化实现了强大的渲染性能,但没有明确强制多视图几何一致性。相比之下,3D 基础模型可以恢复连贯的场景几何形状和相机运动,但其基于点的输出并不是为照片级真实感渲染而设计的。我们提出了 Ground4D,一个建立在两个阶段上的基于几何的框架。首先,我们通过 3D 基础模型执行几何初始化,以 无需训练 方式利用 VGGT 从单目视频重建多视图一致的 3D 几何和相机姿势。恢复的几何形状为动态高斯表示提供了结构化且可靠的初始化。其次,我们通过动态高斯泼溅进行几何一致性感知细化,通过可微分渲染优化表示,同时保持观察和合成视点的多视图几何一致性。此外,Ground4D 本质上对场景的连续 4D 动态进行建模,自然支持任意时间戳的渲染。通过将基础级几何先验集成到动态高斯优化中,Ground4D 实现了更强的重建保真度和渲染性能,强调了基于几何的约束在稳健的 4D 场景建模中的作用。