论文
NeoMap:无需训练 单图像和视频的新颖视图合成
NeoMap: Training-free Novel-View Synthesis from Single Images and Videos
摘要
我们研究从单个图像或单目视频合成新颖视图视频的挑战性问题。现有的方法假设预训练的视频模型缺乏原生新颖的视图合成能力,并通过相机调节、特定于任务的 微调 或逐步硬去噪指导来强制视图对齐,但这些方法通常会出现伪影和全局场景一致性受损。在本文中,我们介绍了 NeoMap,这是一种新颖的 无需训练 框架,旨在从通用预训练视频模型中定位高保真、视图一致的新颖视图解决方案。我们方法的关键是核心洞察,即有前途的新颖视图解决方案本质上是在预训练模型学习的自然视频数据流形中进行编码的,而核心挑战只是找到这个最佳解决方案。我们通过核心机制解决这个问题:收敛流形交替投影迭代优化初始噪声。大量实验表明,NeoMap 在 3 个标准新颖视图合成基准(包括具有挑战性的 Tanks-and-Temples、LLFF 和 DAVIS 数据集)上显着优于所有现有方法,实现了最先进的生成保真度和顶级视图一致性。