论文

UniWorld-View:通过视频扩散模型进行大基线视图合成

UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models

应用与实践内容创作

摘要

社交媒体上大量随意捕捉的单眼视频和图像为沉浸式内容创作提供了宝贵的资源,从这种稀疏的观察中生成新颖的视图可以极大地增强用户体验。然而,当输入覆盖范围极其有限时,通过精确的相机控制生成逼真且几何一致的视图仍然具有挑战性。 NeRF 和 3D Gaussian Splatting (3DGS) 等基于重建的方法在稀疏输入下严重恶化,并且无法显式处理遮挡。生成方法缓解了数据需求,但由于不准确或隐式的几何指导,仍然难以实现大基线视图合成。为了克服这些限制,我们引入了 UniWorld-View,这是一个用于从单目输入进行可控大基线新颖视图合成的统一框架。 UniWorld-View 将显式 3D 引导与生成扩散建模相集成,以实现精确的摄像机控制和几何一致的视图生成。几何引导是通过遮挡感知点云渲染策略获得的,该策略解决了可见性模糊性并为基于扩散的合成提供了准确的先验。通过将此渲染策略与强大的视频扩散主干相结合,UniWorld-View 即使在极端的相机运动和宽基线变化下也能实现高保真新颖的视图生成,并且可以进一步为下游动态 3DGS 重建提供多视图视频。 WorldScore 基准和零样本 NVS 基准的实验证明了 UniWorld-View 在可控性、几何一致性和视觉保真度方面的有效性。