论文
城邦:城市规模的 3D 自我监管
Polis: 3D Self-Supervision at City Scale
摘要
来自城市规模 3D 模型的可靠语义表示对于城市分析、基础设施监控、自治系统和遗产保护越来越重要。然而,通过航空测量捕获的大空间范围的城市场景与用于预训练大多数 3D 自监督模型的室内、物体级和自动驾驶 LiDAR 数据有很大不同。据我们所知,Polis 是草图各向同性高斯正则化 (SIGReg) 的第一个应用,作为本地点云编码器的目标,并通过涵盖 14 个城市和建筑规模的语料库的冻结特征基准对其进行评估。 Polis 将几何匹配的余弦不变性、SIGReg 和 VICReg 式的抗塌陷项与 12.8k 场景的室外预训练混合和重力保持空间视图采样相结合。受控消融表明,在相同的代表性室外语料库上,该目标优于学生-教师架构替代方案以及没有防崩溃项的 Polis 版本。在三个预训练不相交的城市数据集上,Polis 的平均 mIoU 达到 $23.8\%$,而在高容量冻结探测下,次佳编码器的平均 mIoU 为 $16.3\%$;在匹配点和体素预算下,Polis 的平均 mIoU 达到 $17.3\%$,而第二佳编码器的平均 mIoU 为 $16.1\%$。同一个城市规模的领导者拥有在预训练中看到其训练集的数据集。在具有细粒度立面和街景标签的本地化地面捕获中,排名相反。我们的结果表明,分布正则化的联合嵌入架构可以成功应对具有挑战性的城市规模 3D 场景,并且当为捕获该领域的几何和空间背景而设计自我监督时,传输会得到改善,同时也揭示了这种专业化的局限性。