论文
Self-Geometry:几何一致的 3D 视觉基础模型的无需 GT 且即插即用的测试时间调整
Self-Geometry: GT-Free and Plug-and-Play Test-Time Adaptation for Geometrically Consistent 3D Vision Foundation Models
摘要
最近的视觉基础模型 (VFM) 在一次前向传递中预测深度、相机姿态和点图,无需针对每个场景进行优化,从而实现了强大的泛化能力。然而,强制执行明确的多视图几何一致性(例如通过束调整)的计算成本很高,因此在 VFM 预训练期间不会强制执行,因此可能会出现这种不一致。为了解决这个问题,从模型输出(例如,点图、特征)导出的隐式自一致性,尽管在之前的工作中在测试时强制执行,但其性能增益本质上是有限的,特别是在预训练的 VFM 高度不准确的场景中。与这种隐式信号相反,我们提出了 Self-Geometry,这是一种即插即用的测试时适应管道,它使用 2D 像素对应作为伪 真值 直接施加显式多视图几何约束。我们提出的自几何包括几何解缠优化,它将多视图一致性和极线一致性损失与梯度解缠结合起来以防止梯度冲突; Frame Angular-Neighbor,一个基于 SO(3) 测地距离的视图采样器,用于轻微施加这些约束;轻量级 TTA,通过 LoRA 调整 VFM。我们的方法在六个 VFM(VGGT、$π^3$、DA3-Giant/Large/Base/Small)和四个基准(7Scenes、ETH3D、ScanNet++、HiRoom)中实现了姿态和几何估计的一致改进。