论文

从未展示的多视图图像中学习空间智能的 3D 表示

Learning 3D Representations for Spatial Intelligence from Unposed Multi-View Images

模型训练预训练

摘要

强大的 3D 表示学习构成了空间智能的感知基础,支持场景理解和具体人工智能中的下游任务。然而,直接从未摆出的多视图图像中学习这种表示仍然具有挑战性。最近的自监督方法试图以前馈方式统一几何、外观和语义,但它们经常受到几何归纳较弱、外观细节有限以及几何和语义之间不一致的困扰。我们引入了 UniSplat,这是一个前馈框架,旨在通过三个互补组件来解决这些限制。首先,我们提出了一种双掩蔽策略,可以增强编码器中的几何归纳。通过屏蔽编码器和解码器标记,并将解码器掩模定位到几何丰富的区域,该模型被迫从不完整的视觉线索中推断出结构信息,即使在未设定的输入下也能产生几何感知的表示。其次,我们开发了一种从粗到细的高斯泼溅策略,通过逐步细化辐射场来减少外观语义的不一致。最后,为了强制几何语义一致性,我们引入了一种姿势条件重新校准机制,该机制通过使用估计的相机参数将预测的 3D 点和语义图重新投影到图像平面中,将多个头的输出相互关联,并将它们与相应的 RGB 和语义预测对齐以确保跨任务一致性,从而解决几何语义不匹配问题。这些组件共同产生统一的 3D 表示,这些表示对于未摆设的稀疏视图输入具有鲁棒性,并且可以在不同的任务中进行泛化,从而为空间智能奠定感知基础。