论文

SMFormer:通过基础模型和数据增强实现自我监督立体匹配

SMFormer: Empowering Self-supervised Stereo Matching via Foundation Models and Data Augmentation

应用与实践视觉感知与空间理解

摘要

最近的自监督立体匹配方法取得了重大进展。它们通常依赖于光度一致性假设,该假设假设视图中的对应点具有相同的外观。然而,这种假设可能会受到现实世界干扰的影响,导致监督信号无效,并且与监督方法相比存在显着的准确度差距。为了解决这个问题,我们提出了 SMFormer,这是一个集成了由视觉基础模型(VFM)和数据增强指导的更可靠的自我监督的框架。我们首先将 VFM 与特征金字塔网络(FPN)结合起来,提供针对各种场景中的干扰的区分性和鲁棒性的特征表示。然后,我们设计了一种有效的数据增强机制,确保各种转换的稳健性。数据增强机制明确地强制学习特征与受光照变化影响的特征之间的一致性。此外,它还规范了强增强样本的视差预测与标准样本生成的视差预测之间的输出一致性。对多个主流基准的实验表明,我们的 SMFormer 在自监督方法中实现了最先进的 (SOTA) 性能,甚至可以与监督方法相媲美。值得注意的是,在具有挑战性的 Booster 基准测试中,SMFormer 甚至优于一些 SOTA 监督方法,例如 CFNet。