论文
从单张图像构建完整场景
Building Rome from a Single Image
摘要
单图像场景生成旨在从单个图像生成完整的 3D 场景网格,包括相机未观察到的表面。虽然预训练的 3D 对象生成器先对强形状进行编码,但它们主要是针对固定规范体积中的孤立对象而设计的,并且主要关注室内场景,因为室外场景的各种 3D 数据非常有限。在这项工作中,我们提出了一种重新设计这种以对象为中心的生成器的方法,例如 Trellis 2,可以在室内和室外场景上工作,同时保留其先验。我们通过以下方式实现这一点:(a) 将场景划分为自适应块,这些块相对于到相机的距离进行缩放;附近的块具有较小的尺寸以保持更精细的细节,而远处的结构(例如建筑物)则被大块覆盖; (b) 通过提升图像特征并使模型了解自由空间、观察表面和未观察区域,使生成器捕获明确的 2D-3D 对应关系; (c) 合成大约 4,000 个室外场景以扩大训练数据,因为现有场景数据集主要是室内的。对坦克和寺庙、ScanNet++ 和野外图像的实验表明,我们的方法在室内和室外场景的几何精度和感知质量方面优于所有基线。
