论文
OmniRoam:通过长视界全景视频生成进行世界漫游
OmniRoam: World Wandering via Long-Horizon Panoramic Video Generation
摘要
近年来,使用视频生成模型对场景进行建模引起了越来越多的研究兴趣。然而,大多数现有方法依赖于透视视频模型,这些模型仅合成对场景的有限观察,导致完整性和全局一致性问题。我们提出了 OmniRoam,一种可控的全景视频生成框架,它利用丰富的每帧场景覆盖范围和全景表示固有的长期空间和时间一致性,实现长视野场景漫游。我们的框架从预览阶段开始,其中轨迹控制的视频生成模型根据给定的输入图像或视频创建场景的快速概览。然后,在细化阶段,该视频在时间上进行扩展并在空间上进行上采样,以生成长距离、高分辨率的视频,从而实现高保真世界漫游。为了训练我们的模型,我们引入了两个全景视频数据集,其中包含合成视频和真实世界捕获的视频。实验表明,我们的框架在视觉质量、可控性和长期场景一致性方面(无论是定性还是定量)始终优于最先进的方法。我们进一步展示了该框架的几个扩展,包括实时视频生成和 3D 重建。代码可在 https://github.com/yuhengliu02/OmniRoam 获取。