论文
DINOular:自我监督的视觉空间表示
DINOcular: Self-Supervised Visuospatial Representations
摘要
我们引入了一个自监督框架,用于从 RGB-D 观察中学习联合视觉空间表示。虽然现代视觉基础模型几乎只在 RGB 图像上进行训练,但许多具体系统都可以访问显式深度感测,从而提供单眼输入无法恢复的几何信息。我们的方法通过块间和块内融合将深度导出的几何先验与视觉主干集成在一起,使模型能够有效地编码外观和空间结构。由此产生的表示显示出在保留语义迁移的同时在 3D 感知方面取得了有希望的改进:它在多个 3D 几何基准上优于同等规模的现有方法,并且在标准 RGB-D 语义分割任务中保持竞争力。