论文

PointVGGT:使用视觉几何基础先验进行零射击多视图 RGB-D 点云配准

PointVGGT: Zero-Shot Multiview RGB-D Point Cloud Registration with Visual Geometry Foundation Priors

应用与实践视觉感知与空间理解

摘要

本文解决了多视图 RGB-D 点云配准问题,旨在估计无序 RGB-D 扫描的全局刚性姿势,并将它们对齐在度量一致的坐标系中。传统的成对全局范式存在局部优化的成对配准、严重的错误传播和高计算负担的问题。特别是,现有方法通常将 RGB 数据仅视为辅助匹配线索,而忽略跨图像序列编码的整体几何先验(例如,相机姿势和 3D 模型)。本文介绍了 PointVGGT,这是一种建立在新颖的 \emph{foundation-then-refinement} 范式之上的零样本框架,该范式系统地利用视觉几何基础模型(例如 VGGT)作为稳健、免训练的多视图 RGB-D 配准的计算骨干。在基础阶段,我们通过将基础模型的尺度模糊姿态预测与度量深度观测结合起来,直接恢复度量一致的全局姿态(无需任何成对估计)。在细化阶段,我们引入了一种高效的 体素化空间哈希机制,利用全局相干 3D 重建(由基础模型引起)作为共享空间锚点,在近线性时间内实现密集的多视图对应。除此之外,使用共轭梯度求解器执行基于 IRLS 的鲁棒仅运动束调整,以联合最小化多视图姿态细化的对应和重投影残差。对室内/以对象为中心/室外数据集的大量实验验证了我们提出的方法出色的零样本配准精度和计算效率。