论文
Glob3R:具有 3D 基础模型的全局运动结构
Glob3R: Global Structure-from-Motion with 3D Foundation Models
摘要
最近的 3D 几何基础模型(例如 VGGT)通过直接预测输入图像中的相机姿态和 3D 场景点来提供强大的前馈 3D 重建。然而,它们的结果仍然不准确,并且将它们缩放到长序列或大型无序图像集通常需要分块处理,这可能会引入漂移和不一致。我们推出了 Glob3R,这是一种基于 3D 基础模型构建的全局 SfM 式重建。我们的关键思想是显式优化前馈几何预测。为此,我们用轻量级密集匹配头增强了冻结的 Pi3X 主干,该头可以预测所选参考帧和相邻视图之间的图像扭曲。这些密集的扭曲被转换为稀疏但可靠的多视图特征轨迹,为全局优化提供对应约束。我们进一步引入了基于关键帧的滑动窗口关联策略,该策略可以跨重叠窗口传播轨迹和相对姿势,从而实现可扩展的重建。最后,我们执行全局运动平均和捆绑调整以细化相机姿势,减少尺度不一致并恢复密集的场景几何形状。对室内、室外、大规模驾驶和无序 SfM 基准的大量实验表明,Glob3R 实现了稳健且准确的重建。它不断改进前馈基础模型基线和最近的可扩展重建方法,同时比经典的 SfM 管道更稳健。精致的姿势还可以带来更高质量的神经渲染,验证了将基础模型先验与全局几何优化相结合的好处。项目页面:https://junyuandeng.github.io/Glob3r