论文
可聚焦单眼深度估计
Focusable Monocular Depth Estimation
摘要
单目深度基础模型可以很好地跨场景推广,但它们通常使用统一的像素级目标进行优化,这些目标无法将用户指定或任务相关的目标区域与周围环境区分开来。因此,我们引入可聚焦单目深度估计(FDE),这是一种区域感知深度估计任务,其中给定指定的目标区域,模型需要优先考虑前景深度精度,保留清晰的边界过渡,并保持连贯的全局场景几何形状。为了优先考虑任务关键区域建模,我们提出了 FocusDepth,这是一种提示条件单目相对深度估计框架,可指导深度建模通过框/文本提示聚焦于目标区域。 FocusDepth 中的核心多尺度空间对齐融合 (MSSA) 在空间上对齐从 Segment Anything Model 3 到 Depth Anything 系列的多尺度特征,并通过特定于尺度的门控条件融合注入它们。这使得能够在不破坏几何表示的情况下进行密集的提示提示注入,从而赋予深度估计模型集中的感知能力。为了研究 FDE,我们建立了 FDE-Bench,这是一个以目标为中心的单目相对深度基准,由五个数据集的图像目标深度三元组构建,包含 252.9K/72.5K 训练/验证三元组和跨越现实世界和具体模拟环境的 972 个类别。在 FDE-Bench 上,FocusDepth 在框和文本提示下持续改进全局微调的 DA2/DA3 基线,最大增益出现在目标边界和前景区域,同时保留全局场景几何形状。消融表明 MSSA 的空间对齐是关键的设计因素,因为破坏提示几何对应关系会使 AbsRel 增加高达 13.8%。