论文
SS3D:来自网络视频的端到端自我监督 3D
SS3D: End2End Self-Supervised 3D from Web Videos
摘要
我们提出了 SS3D,一种基于 SfM 的网络规模自监督预训练管道,用于单目视频的前馈 3D 估计。我们的模型在一次前向传递中联合预测深度、自运动和相机内参,并作为连贯的端到端 3D 估计器进行训练/评估。为了稳定联合学习,我们使用相机内参优先的两阶段计划和统一的单检查点评估协议。由于多视图可观测性较弱且语料库异质性较强,将 SfM 自我监督扩展到无约束的网络视频具有挑战性;我们通过用于过滤和课程采样的多视图信号代理(MVS)以及针对单个学生的专家训练来解决这些问题。在 YouTube-8M(过滤后约 100M 帧)上进行预训练可产生强大的跨域零样本传输,并比之前的自监督基线提高了 微调 性能。我们发布预训练的检查点和代码。