论文

DepthEvidence:把度量深度变成可用于语言推理的证据

DepthEvidence: Unifying Metric Depth Prediction and Geometric Reasoning in Multimodal Language Models

应用与实践视觉感知与空间理解

摘要

具有度量约束的空间推理需要将对象与几何测量联系起来,并在语言推理过程中保留其数字内容。我们提出了 DepthEvidence,这是一个 4B 模型,它使用自己的密集度量预测作为语言生成的基于对象的证据。相机条件解码器使用多尺度视觉特征和高分辨率 RGB 细化来预测全分辨率度量深度。密集语言接口将预测深度和解码器特征转换为锚定到对象标识符的对象对齐连续几何标记。几何监督鼓励度量信息在语言上下文交互之前和之后保持可恢复,而指令调整支持对象测量和组合推理。我们引入了 Depth-VQA 基准,用于评估对象深度查询、相对比较以及结合空间和数值约束的决策。在九个数据集中,DepthEvidence 在评估方法中实现了最高的平均稠密深度指标 $δ_1$,可与专业估计器竞争。它还在实例级度量深度估计以及相对和度量推理轨道上的整体准确性方面领先于评估方法,同时广泛保留了一般 VQA 性能并提高了相对于基本模型的空间理解。

DepthEvidence展示度量空间推理、稠密深度、深度问答及通用视觉问答能力。
图1(图注摘要):DepthEvidence展示度量空间推理、稠密深度、深度问答及通用视觉问答能力。