论文

重新审视跨视图完成:通过重构误差比较进行自我监督 预训练

Revisiting Cross-View Completion: Self-Supervised Pre-Training via Reconstruction Error Comparison

模型训练预训练

摘要

自监督 预训练 通过交叉视图补全从图像对的共同可见区域学习 3D 视觉的强大特征。然而,参考视图提供的用于重建非共可见斑块的信息很少,隐含地在这些区域中产生单眼训练信号。我们引入了 Gekko,它将这种限制转化为有用的信号。跨视图重建误差相对于掩模自动编码器误差的相对改进是共同可见性的自监督代理:较大的改进表明共同可见区域,可忽略不计的改进表明非共同可见区域。 Gekko 是一个从头开始训练的网络,它联合执行跨视图补全、屏蔽自动编码和这种相对改进的每像素预测,为所有屏蔽区域提供额外的双目信号,而无需任何 真值 3D 注释。在相同的架构和训练数据下,Gekko 在零样本对应估计、相对姿态估计和点图回归方面始终优于 CroCo,在最严格的相对姿态阈值下精度提高了 6 倍,并且在 ETH3D 上端点误差下降了 22%。它学习的额外通道本身就是对未见过的场景的强大的共同可见性检测器,并且 Gekko 的冻结功能优于已发布的同等或更大尺寸的跨视图主干。它还可以通过简单的基于步幅的课程直接从原始视频进行训练,消除了先前方法所需的繁琐的 3D 预处理,同时匹配在精选数据上训练的模型。代码和预训练模型是公开的。