论文
MoVerse:使用全景高斯支架进行实时视频世界建模
MoVerse: Real-Time Video World Modeling with Panoramic Gaussian Scaffold
摘要
我们推出了 MoVerse,这是一种实时视频世界模型,可以从单个窄视场图像创建交互式可导航场景。这种设置具有挑战性,因为输入仅观察环境的一小部分,而交互式漫游需要完整的周围世界、持久的几何形状、可控的相机运动和时间相干的高保真观察。 MoVerse 通过将世界构建与观察渲染分开来解决这个问题。它首先将输入扩展为具有拓扑感知扩散的重力对齐 360$^\circ$ 全景图,在 3D 推理之前关闭缺失的视野。然后,它使用全景几何感知残差预测将全景图提升到持久的 3D 高斯支架中,从而产生密集且可直接渲染的空间记忆。最后,高斯条件视频渲染器将沿着用户指定的相机轨迹的脚手架渲染转换为逼真的视频。为了使该渲染器适用于交互,我们训练了一个用于高质量条件渲染的双向扩散教师,并将其提炼为一个用于有限延迟流的因果自回归学生。该设计将显式 3D 表示的可控性和远程一致性与生成视频模型的感知质量结合起来。 MoVerse 支持在单个 NVIDIA RTX~4090 GPU 上以 8~FPS 的速度进行实时场景漫游,展示了通过交互式视频输出创建单图像世界的实用路径。