论文

VLRC:视觉语言重投影一致性作为可扩展信号,以实现更好的前馈 3D 预训练

VLRC: Vision-Language Reprojection Consistency as a scalable signal for better feed-forward 3D pretraining

模型训练预训练

摘要

前馈 3D 模型通常使用昂贵的几何监督或自监督光度目标进行训练,这两者都提供不完整的学习信号。我们引入了视觉语言重投影一致性(VLRC),这是一种可扩展的辅助目标,它利用冻结的视觉语言表示作为语义多视图监督。给定预测的 3D 重建,VLRC 跨视图重新投影密集的视觉语言特征,并强制相应图像位置之间的特征一致性,无需额外的 3D 注释。该目标在无标记适应过程中与自监督单目重建和监督预训练前馈 3D 模型无缝集成。通过将几何与基于语言的特征对齐,VLRC 不仅改进了深度和相机估计,而且还实现了更连贯的多视图语义融合,以实现开放词汇 3D 场景理解。室内和室外基准测试证明了 3D 重建精度和零样本开放词汇 3D 语义分割的一致增益。