论文
SPACE-CLIPv2:从冻结 CLIP 中解码局部几何以进行单目深度估计
SPACE-CLIPv2: Decoding Local Geometry from Frozen CLIP for Monocular Depth Estimation
摘要
CLIP 等视觉语言基础模型提供了强大的语义表示,但它们的补丁token并未直接针对密集度量几何进行优化。 SPACE-CLIP 表明,冻结的 CLIP 特征可以通过层组特征融合支持单目深度估计,但它仍然没有解决如何组合相邻 CLIP token来恢复精细局部结构的问题。我们提出了 SPACE-CLIPv2,一种冻结骨干模型深度解码器,它聚合 CLIP token空间中的固定局部邻域。在选定的解码器阶段,模型对固定的token模板进行采样,预测聚合权重,并通过门控残差更新注入结果响应。 token空间高通分支进一步保留浅层局部对比度。在 NYU Depth V2 上,SPACE-CLIPv2 比匹配的 SPACE-CLIP 基线有所改进,而五种子实验始终倾向于固定采样而不是学习偏移采样。零样本 iBims-1 评估进一步改进了边界和平面几何测量。这些结果支持约束局部token聚合作为从冻结 CLIP 表示解码几何的实用机制。
