论文
野外视觉几何 Transformer:无干扰 3D 重建
Visual Geometry Transformer in the Wild: Distractor-Free 3D Reconstruction
摘要
当前的端到端多视图 3D 重建方法取得了令人印象深刻的结果,但依赖于限制性静态假设:场景完全没有干扰,具有完美的交叉视图几何形状。这种对理想化输入的依赖导致即使是最先进的方法在存在短暂干扰和遮挡的现实环境中也会失败。为了解决这个问题,我们提出了 Visual Geometry Transformer in the Wild (VGTW),这是一种端到端框架,用于从不一致的视图中进行稳健重建。其核心是,我们隔离并抑制受干扰因素影响的区域,同时保留跨视图的一致组件。具体来说,我们引入了一种干扰感知训练(DAT)策略,该策略在注意力机制中将干净的特征与干扰干扰污染的特征分开,同时强制跨图像的特征一致性。为了实现这一点,我们使用辅助掩模预测头来训练模型,并使用我们通过像素级干扰掩模收集的新数据集进行监督。由此产生的 VGTW 模型是一个前馈网络,可直接输出干净、无干扰的点云。值得注意的是,它不需要额外的 3D 监督,保持计算效率,并且与现有管道兼容。大量的实验验证了我们的方法,在不同的现实场景中展示了最先进的性能和强大的泛化能力。