论文
以最后一层为中心的特征重组:释放 DINOv3 中的 3D 几何知识以进行单目深度估计
Last-Layer-Centric Feature Recombination: Unleashing 3D Geometric Knowledge in DINOv3 for Monocular Depth Estimation
摘要
单目深度估计(MDE)是一项基本但本质上不适定的任务。最近的视觉基础模型 (VFM),特别是基于 DINO 的 Transformer,显着提高了密集预测的准确性和泛化能力。先前的工作通常遵循统一的范例:以均匀的间隔对一组固定的中间 Transformer 层进行采样以构建多尺度特征。这种常见做法隐含地假设几何信息在各层之间均匀分布,这可能未充分利用 VFM 中编码的结构 3D 线索。在这项研究中,我们对 DINOv3 进行了系统的分层分析,揭示了 3D 信息分布不均匀:更深的层表现出更强的深度可预测性,并更好地捕获样本间的几何变化。受此启发,我们引入了最后一层中心特征重组(LFR)模块来增强几何表现力。 LFR 将最后一层视为几何锚点,并根据最小相似性标准自适应地选择互补的中间层。选定的特征通过紧凑的线性适配器与最后一层表示融合。大量实验表明,LFR 模块持续提高了 MDE 精度并实现了最先进的性能。我们的分析揭示了几何知识在 VFM 中的组织方式,并提供了一种有效的策略来释放其在密集 3D 任务中的潜力。