论文
少解码器多编码器:新视角合成的几何表示学习
Less Decoder is More Encoder: Geometric Representation Learning from Novel View Synthesis
摘要
本文考察新视角合成(NVS)在几何表示学习中的角色。原则上NVS应推理3D场景结构,从而支持可迁移的多视图几何表示。但既有基于编码器的NVS方法产出糟糕表示——这不是监督信号匮乏,而是不显眼架构选择所致:稀释场景编码器表示能力的空间表达解码器,与阻碍特征学习的低层像素空间目标。我们提出SNAP——自监督编码器-解码器transformer,以位姿条件局部解码器与潜空间重构目标解决两者。SNAP任务无关,我们展示它与专用几何监督方法竞争;并在五任务(视觉定位、位姿估计、点对应、深度估计、机器人操作)上与自监督表示表现相当。值得注意的是,SNAP的patch特征涌现出接近重监督模型的视角不变性——尽管计算与数据预算更低。在标准2D表示崩溃的相机偏移下,SNAP退化更优雅,揭示限制解码器表达力主动防止可迁移几何结构被抑制。代码/项目页:https://snap-nvs.github.io。