论文

密集空间感知的视觉预训练

Vision Pretraining for Dense Spatial Perception

模型训练预训练

摘要

密集的空间感知对于物理智能至关重要,视觉系统期望从像素观察中恢复结构化、度量和可操作的表示。现代视觉基础模型倾向于优先考虑语义不变性,通常以牺牲详细的空间理解为代价。在这项工作中,我们通过以边界为中心的镜头研究视觉预训练,其动机是边界和形状不连续性为感知几何特性提供了重要的线索。具体来说,我们提出了屏蔽边界建模,这是一种自监督范例,可以动态学习子像素边界表示,然后利用发现的边界承载标记作为屏蔽目标来促进密集的视觉标记学习。通过扩展该框架,我们开发了 LingBot-Vision,并以 DINOv3 作为强大的基线,在一系列不同的下游视觉任务中展示了其功效。值得注意的是,LingBot-Vision 推动了深度完成从 LingBot-Depth 1.0 到 LingBot-Depth 2.0 的进展,从而产生增强的深度估计,这是嵌入式人工智能的关键支柱。我们的研究结果表明,边界建模超越了简单的线段,而是作为学习空间结构化视觉表示的可扩展预训练原则。