论文
通过深度排序任务将图像提示理解与 VLM 中的语言偏差分开
Disentangling Pictorial Cue Understanding from Language Bias in VLMs via Depth Ordering Task
摘要
在本文中,我们研究视觉语言模型(VLM)的深度感知,以隔离图像深度线索的影响,并理清视觉和语言对模型性能的影响。为此,我们将深度排序和奇一心理物理学任务结合起来:向 VLM 呈现图像,其中一个对象相对于其他相同的对象处于不同的深度,并且必须确定奇一目标距离观察者是更近还是更远。为了创建刺激,我们从模拟和真实 3D 场景生成 2D 视图,同时控制各个图像深度线索的存在,从而能够对线索级别的贡献进行细粒度分析。通过改变所指表达的清晰度来检查语言效果。我们还引入了一种新颖的指标来量化视觉与语言的敏感性。应用这种方法,我们创建了包含 37K 真实图像和合成图像以及 147K 图像问题对的奇一出深度 (O3-D) 数据集。对 O3-D 上 12 个开源和商业模型的评估显示,深度线索的利用不足,深度排序准确度在 47% 到 56% 之间,没有模型高于机会水平。与此同时,我们的指标揭示了答案中强烈的语言偏见。思想链(CoT)和上下文学习(ICL)都没有显着提高性能,这表明仅静态图像数据可能不足以深度理解。所有代码、图像生成管道和 O3-D 数据集均在 https://github.com/lyiqian/o3-d 公开发布。