论文

HD-VGGT:高分辨率视觉几何 Transformer

HD-VGGT: High-Resolution Visual Geometry Transformer

应用与实践视觉感知与空间理解

摘要

高分辨率图像对于精确的 3D 重建至关重要,因为许多几何细节只能在精细的空间尺度上显现。最近的前馈方法,例如 Visual Geometry Grounded Transformer (VGGT),已经证明了在单次前向传递中从大量图像集合推断场景几何的能力。然而,将这些模型扩展到高分辨率输入仍然具有挑战性:Transformer 架构中的词元数量随着图像分辨率和视图数量的增加而快速增长,导致计算和内存成本过高。此外,我们观察到视觉上模糊的区域,例如重复图案、弱纹理或镜面,通常会产生不稳定的特征标记,从而降低几何推理的性能,尤其是在较高分辨率的情况下。我们引入了 HD-VGGT,这是一种用于高效、稳健的高分辨率 3D 重建的双分支架构。低分辨率分支预测粗略的、全局一致的几何形状,而高分辨率分支通过学习的特征上采样模块细化细节。为了处理不稳定的词元,我们提出了特征调制,它可以在 Transformer 早期抑制不可靠的特征。 HD-VGGT 利用高分辨率图像和监督,无需全分辨率 Transformer 成本,实现最先进的重建质量。