论文
BINO:具有本地对输入的以编码器为中心的自监督立体声
BINO: Encoder Centric Self Supervised Stereo With Native Pair Input
摘要
立体需要保留精细的跨视图对应性而不仅仅是语义相似性的功能。最近的自监督视觉模型转移得很好,但它们并不是为此目标而构建的,并且以几何为中心的方法在预训练期间通常依赖于双目解码器或另一个显式链接模块。 BINO 询问是否可以在紧凑的编码器内学习强大的双目结构。它通过在输入级融合整流对、形成立体声微单元词元并使用行感知补丁相位位置编码来实现这一点。训练仅使用一种视图屏蔽标记 蒸馏 以及遮挡和视图特定外观不匹配。在严格的低资源设置中,仅在 KITTI 对象上进行预训练,在代理密集立体、硬负检索和 KITTI Stereo~2012 视差的所有比较基线中,BINO 在无链接探测下给出了最佳的冻结描述符结果。每个编码器都使用相同的轻量级立体声头,它在使用更小的编码器的同时保持接近 CroCo~v2。 KITTI Stereo~2015 上的补充传输实验显示出相同的定性趋势。这些结果表明,通常分配给单独链接模块的大部分交叉视图推理可以在紧凑且可重用的编码器内学习。