论文
更少的上下文,更好的几何:用于稳健 3D 基础模型的掩码几何编码器
Less Context, Better Geometry: Masked Geometric Encoder for Robust 3D Foundation Models
摘要
3D 基础模型的最新进展通过利用从大量空间数据中学习到的 3D 先验知识,实现了快速 3D 重建和相机校准。然而,all-to-all全局注意力设计导致二次复杂度并限制了长序列推理;不受约束的跨视图交互还可能从被遮挡或视觉上相似但几何上遥远的视图传播不可靠的证据。在本文中,我们介绍了一种掩码几何编码器(MGE),它促进了不完整的跨视图上下文下鲁棒几何表示的学习。在训练期间,MGE 策略性地将框架token从全球关注中剔除,并从预训练的全上下文教师模型模型中提取出来。这使得模型能够学习本质上更丰富的每帧表示,同时提供足够的中间监督以避免性能下降。通过大量的实验,我们表明 MGE 在遮挡和分身视图下具有更强的性能,同时在标准基准上保持高性能。这种更丰富的帧表示还可以在推理过程中更有效地减少token。为此,我们开发了一种新颖的锚引导自适应token合并技术,该技术保留代表性锚帧,同时联合合并剩余视图中的冗余token。与其他有效的推理方法相比,我们可以实现推理加速,同时始终保持更高的重建质量,特别是在有限视图设置中。
