论文

FrameCrafter:新颖的视图合成作为视频完成

FrameCrafter: Novel View Synthesis as Video Completion

应用与实践内容创作

摘要

我们使用视频扩散模型解决稀疏新颖视图合成(NVS)问题;给定 $K$ ($\approx 5$) 个场景的多视图图像及其相机姿势,我们从目标相机姿势预测视图。许多现有方法利用通过扩散模型编码的生成图像先验。然而,在单个图像上训练的模型缺乏多视图知识。相反,我们认为视频模型已经包含隐式多视图知识,因此应该更容易适应 NVS。我们的主要见解是将稀疏 NVS 制定为低帧率视频完成任务。然而,一个挑战是稀疏 NVS 是在一组无序输入上定义的,通常太稀疏而无法接受有意义的顺序,因此模型对于该输入集的排列应该是$\textit{invariant}$。为此,我们提出了 FrameCrafter,它通过一些架构修改(包括每帧潜在编码和删除时间位置嵌入)使视频模型(自然地使用连贯帧排序进行训练)适应排列不变的 NVS。我们的结果表明,视频模型可以轻松训练,以最少的监督“忘记”时间,从而在稀疏视图 NVS 基准测试中产生具有竞争力的性能。项目页面:https://frame-crafter.github.io/