论文
RoGe:通过端到端隐式重建和生成进行新颖的视图合成
RoGe: Novel View Synthesis via End-to-End Implicit Reconstruction and Generation
摘要
从稀疏输入合成新的视图需要来自观察到的视图的几何基础和未观察到的区域的生成先验,这激发了最近结合重建和生成的混合方法。然而,现有方法通过渲染图像或显式 3D 表示(例如点图或 3D 高斯)将两者联系起来。因此,生成以场景的有损且不完美的投影为条件,继承了其错误,并且重建没有从生成接收信号来纠正它们。我们提出了 RoGe,一个端到端的统一重建和生成框架,消除了这种显式的桥梁。它的目标是在由稀疏视图锚定的场景中漫游:给定一些姿势图像和相机轨迹,它沿着该轨迹合成时间连贯的视频。 RoGe 根据稀疏输入视图,使用前馈重建模型构建隐式场景表示,并使用目标摄像机光线对其进行查询以获得每个视图的几何特征。这些特征被注入到视频扩散模型中作为调节,无需任何 3D 中间体。两个模块都是联合训练的,因此生成目标直接塑造自己的几何条件。我们在 DL3DV 上进行了实验,其中 RoGe 在图像级指标和视频级时间一致性方面优于基于重建、基于生成和混合基线。消融证实,光线查询隐式特征优于原始重建标记和渲染 RGB 作为条件,并且联合训练带来了进一步的收益。我们的项目页面位于 https://jerry-locker.github.io/roge/。