论文
MVDG:无约束现实世界图像的高效多视图 3D 消歧
MVDG: Efficient Multi-view 3D Disambiguation on Unconstrained Real-World Images
摘要
不同但视觉上相似的 3D 表面(分身)之间的虚幻匹配仍然是大规模、野外 3D 重建和视觉定位的基本障碍。先前的工作通过成对分类器缓解了这个问题,但这种设计限制了多视图上下文推理,并导致下游运动结构 (SfM) 的推理复杂度为 O(n^2)。我们提出了 MVDG,一种基于 3D 基础模型 VGGT 构建的可扩展多视图消歧框架,它对任意数量的多视图图像进行联合推理。通过结合 3D 感知多视图功能,我们的方法通过在一次传递中对视图进行编码和解码,减少了对成对比较的依赖。我们进一步观察到 VGGT 的直接多视图微调在噪声监督下可能不稳定;受 Doppelgangers 中标签模糊性的启发,我们从 AerialMegaDepth 构建了一个伪成对训练集,并表明对采样子集的微调可以产生稳定的优化和对保留场景的强泛化。最后,由于完整的 SfM 评估(即使使用更快的管道,例如 GLOMAP)仍然昂贵,因此我们处理伪成对数据集以进行有效验证;我们得出了常规 SfM 指标与此伪成对测试的分类准确性之间的预测关系。实验表明,我们的方法实现了可比较的成对精度,同时相对于基线提高了 SfM 精度和推理速度。