论文
$\text{VG}^2$GT:体素高斯溅射视觉几何对齐 Transformer
$\text{VG}^2$GT: Voxel-Gaussian Splatting Visual Geometry Grounded Transformer
摘要
高斯泼溅在 3D 重建和新颖的视图合成方面显示出强大的潜力。然而,大多数现有方法需要准确的相机参数和每个场景的优化,而具有像素对齐高斯基元的前馈方法通常会受到伪影和不均匀基元的影响。在本文中,我们提出了 $\text{VG}^2$GT,一种基于体素高斯泼溅视觉几何的 Transformer。 $\text{VG}^2$GT 利用冻结的预训练视觉基础模型(VFM),结合多尺度可微体素模块来增强几何理解,并直接从体素特征中分割和回归高斯原始参数。在训练期间,通过随机实体体渲染来监督深度图,从而实现几何精确的高斯场景重建,同时保持视觉基础模型完全冻结。这种设计使得 $\text{VG}^2$GT 能够无缝插入任何基于补丁特征的 VFM,同时大幅降低所需的训练成本。 $\text{VG}^2$GT 在广泛使用的 DTU、Replica、TAT 和 ScanNet 数据集上优于当前最先进的方法。