论文

用于单目深度估计的轻量级提示引导 CLIP 适应

Lightweight Prompt-Guided CLIP Adaptation for Monocular Depth Estimation

模型训练参数高效训练

摘要

利用 CLIP 等视觉语言模型 (VLM) 的丰富语义特征来执行单目深度估计任务是一个有前途的方向,但通常需要大量的 微调 或缺乏几何精度。我们提出了一个名为 MoA-DepthCLIP 的参数高效框架,它采用预训练的 CLIP 表示形式,以最少的监督进行单目深度估计。我们的方法将轻量级适配器混合 (MoA) 模块集成到预训练的 Vision Transformer (ViT-B/32) 主干中,并与最终层的选择性 微调 相结合。该设计在全局语义上下文向量和混合预测架构的指导下实现了空间感知适应,该架构将深度仓分类与直接回归相结合。为了提高结构精度,我们采用复合损失函数来强制几何约束。在 NYU Depth V2 基准上,MoA-DepthCLIP 取得了具有竞争力的结果,通过将 $δ_1$ 精度从 0.390 提高到 0.745,并将 RMSE 从 1.176 降低到 0.520,显着优于 DepthCLIP 基线。这些结果是在需要很少的可训练参数的情况下实现的,证明轻量级、即时引导的 MoA 是将 VLM 知识转移到细粒度单目深度估计任务的高效策略。