论文
作为几何学习者的视频生成模型
Video Generative Models as Geometry Learner
摘要
最近的几何估计生成方法采用了预训练的图像扩散模型,并将任务视为图像条件生成。利用现成的图像扩散模型,他们要么(i)独立训练特定于任务的几何模型(用于深度和表面法线估计),从而失去探索这些几何目标的内在相关性的机会,要么(ii)联合微调修改后的图像扩散主干(例如改变的自注意力),这通常需要大量标记数据。为了以原则性的方式克服这些限制,我们将预训练的视频生成模型重新用作几何估计的统一且数据高效的框架,创新地制定为下一帧预测任务。我们的方法 GeoNeXt 继承了视频模型的自然结构化知识和更丰富的先验知识,同时进一步调整它们以用于图像和几何目标(图像 <-> 几何)的联合建模,从而实现更高效的数据学习和更有效的几何学习。大量的实验验证了我们在不同数据集上进行零样本单目深度和表面法线估计的方法,其性能优于之前的特定任务和统一生成竞争对手,同时使用的训练数据大大减少。值得注意的是,我们的方法可以与基于超过 100 倍以上数据进行训练的最先进的判别方法相媲美,甚至在多个基准测试中表现出色。