论文
当深度比展示更好时:视觉语言空间推理的深度顺序提示
When Depth Is Better Told Than Shown: Depth-Ordinal Prompting for Vision-Language Spatial Reasoning
摘要
视觉语言模型 (VLM) 有望对物理空间进行推理——哪个物体更近,什么物体后面有什么,以及物体如何以 3D 形式排列——但它们仍然难以进行此类空间判断。一种自然的补救措施是向模型显示深度图,但我们发现这会使性能变差。我们证明深度并不存在:它到达了语言模型,但难以访问下游推理,而渲染的伪深度图充当冻结 VLM 无法轻松调节的噪声辅助图像。我们提出深度序数提示(DOP),这是一种 无需训练 方法,可将单目深度转换为查询对象处的单个问题目标序数文本提示,无需添加深度图像、训练模块、注入特征或使用标签。我们的主要发现是形式依赖性:相同的深度信号在以图像形式显示时可能会造成伤害,但以文本形式呈现时会有所帮助。在基准、模型和深度估计器中,当伪深度提供可靠的对象级排序时,DOP 可以改善空间推理,并且在强大的原始图像体系中保持基本中立。它还可以与最强大的 无需训练 深度提示替代方案竞争,同时更简单、更有针对性。