论文
扩展大视图合成模型以实现多视图全景分割
Extending a Large View Synthesis Model for Multi-view Panoptic Segmentation
摘要
大视图合成模型通过跨视图注意力合成新颖的视图,无需明确的 3D 表示,最近的研究表明,它们仅从 RGB 监督中学习准确的空间对应关系。我们观察到这种对应关系超越了表象。当非真实感信号(例如二进制编码的全景标签)通过模型时,它们会传播到具有一致空间结构的新视图。这些结果表明,为 RGB 视图合成学习到的对应关系也可以传播独立于视图的每像素标签。根据这一观察,我们提出了第一个将大视图合成模型从外观渲染扩展到 3D 场景理解的工作。我们提出了一种全景分割管道,它重用冻结视图合成模型将全景标签从输入视图传播到新视图,而无需 3D 重建或视图合成模型的任何特定于分割的训练。给定输入视图上的全景标签,我们将它们编码为二进制通道表示,并将它们传递到相同的模型以渲染目标视图分割。在 ScanNet 上,我们的方法实现的分割质量与需要显式 3D 重建的基于高斯的方法相当,同时在新颖的视图合成方面优于它们 7 dB 以上。标签传播还跨数据集传输,超越了副本上的这些方法,无需任何 微调。