论文
在视觉语言模型中使用空间指示表达式的多语言能力评估
Evaluation of Multilingual Ability to Use Spatial Deictic Expressions in Vision-Language Models
摘要
视觉语言模型(VLM)的预期能力之一是基于给定文本和图像的空间推理能力。为了评估 VLM 的空间推理能力,我们重点关注空间指示表达式的使用,空间指示表达式被定义为其所指对象由情境上下文决定的空间表达式,例如“this”和“that”。为了处理空间指示表达式,VLM 必须对语言和视觉空间进行联合推理,将上下文相关的参考建立在图像的空间结构中。此外,跨语言选择适当的空间指示表达式需要 VLM 理解由这些表达式编码的特定于语言的空间区别。在本文中,我们开发了一个基准来评估 VLM 使用四种语言的空间指示表达式的多语言能力。我们使用该基准的实验表明,测试模型使用指示词的方式与人类不同,特别是根据与物体的距离选择适当的指示词。