论文

SPACE-CLIPv2:从冻结 CLIP 中解码局部几何以进行单目深度估计

SPACE-CLIPv2: Decoding Local Geometry from Frozen CLIP for Monocular Depth Estimation

应用与实践视觉感知与空间理解

摘要

CLIP 等视觉语言基础模型提供了强大的语义表示,但它们的补丁token并未直接针对密集度量几何进行优化。 SPACE-CLIP 表明,冻结的 CLIP 特征可以通过层组特征融合支持单目深度估计,但它仍然没有解决如何组合相邻 CLIP token来恢复精细局部结构的问题。我们提出了 SPACE-CLIPv2,一种冻结骨干模型深度解码器,它聚合 CLIP token空间中的固定局部邻域。在选定的解码器阶段,模型对固定的token模板进行采样,预测聚合权重,并通过门控残差更新注入结果响应。 token空间高通分支进一步保留浅层局部对比度。在 NYU Depth V2 上,SPACE-CLIPv2 比匹配的 SPACE-CLIP 基线有所改进,而五种子实验始终倾向于固定采样而不是学习偏移采样。零样本 iBims-1 评估进一步改进了边界和平面几何测量。这些结果支持约束局部token聚合作为从冻结 CLIP 表示解码几何的实用机制。

SPACE-CLIPv2:从冻结 CLIP 中解码局部几何以进行单目深度估计的原论文方法或结果图
图 1:SPACE-CLIPv2 概述。冻结的 CLIP 视觉编码器向可训练深度解码器提供分组的补丁token映射。 SPACE-CLIPv2 通过固定的本地token聚合增强层级特征融合:每个选定的解码器阶段读取固定的token空间邻域,预测聚合权重,并通过门控残差更新注入聚合响应。浅token细节分支作为二次细化路径包含在内,并固定在核心消融中。