论文
使用 3D 基础模型场景表示的零样本新颖深度合成
Zero-Shot Novel Depth Synthesis Using 3D Foundation Models Scene Representations
摘要
VGGT 等 3D 基础模型 (3DFM) 最近通过前馈 Transformer 预测丰富的统一表示,突破了 3D 视觉的界限。这些模型学习的场景表示能够在多个 3D 视觉任务上发挥出色的性能。在本文中,我们研究使用它们的内部表示从新视图推断场景中的 3D。我们的假设是,为了解决 3D 重建的任务,这些模型需要学习包含大量有关 3D 场景的一般知识的表示。在证明可以从内部 3DFM 表示解码隐藏表面之后,我们提出了一种方法 Z3D,该方法通过对 3DFM 表示进行潜在扩散来估计未见视图中的点图。我们证明 Z3D 可以预测跨多个数据集的新视图的真实深度图。