论文

IVGT:用于神经场景表示的隐式视觉几何 Transformer

IVGT: Implicit Visual Geometry Transformer for Neural Scene Representation

应用与实践视觉感知与空间理解

摘要

从未摆出的多视图图像中重建连贯的 3D 几何和外观是计算机视觉中的一个基本但具有挑战性的问题。大多数现有的视觉几何基础模型通过回归像素对齐的点图来预测显式几何,通常存在冗余和有限的几何连续性。我们提出了 IVGT,一种隐式视觉几何 Transformer,它从无姿态多视图图像中隐式建模连续且连贯的几何。该公式学习规范坐标系中的连续神经场景表示,并支持任何 3D 位置的连续空间查询,检索局部特征以使用轻量级解码器预测符号距离 (SDF) 值和颜色。它允许直接提取连续且连贯的表面几何形状,从而能够从任意视点渲染 RGB 图像、深度图和表面法线图。我们通过 2D 监督和 3D 几何正则化的多数据集联合优化来训练 IVGT。 IVGT 展示了跨场景的泛化能力,并在各种任务上实现了强大的性能,包括网格和点云重建、新颖的视图合成、深度和表面法线估计以及相机姿态估计。