论文

POVBench:从情境推断观察者视角的视觉语言模型空间推理评测

Contextual Observer Grounding: Evaluating Situated Spatial Reasoning in Vision-Language Models

模型评测基准与评测资源

摘要

在机器人等具体任务中对语言指令进行推理通常需要从说话者所处的角度理解空间关系。人类从共享的环境知识、活动背景和常识中推断出这些观点。最近的视觉语言模型(VLM)似乎能够进行空间推理,但它们从上下文线索推断说话者的观点并从该观点解释所处空间关系的能力仍不清楚。我们将这种能力称为情境观察者视角定位。为了研究这种能力,我们构建了视点基准 (POVBench),这是一个 3D 场景和查询的数据集,可以解开自然具身交流中的观察者的推断、陈述和给定形式。给定多视图观察和自然语言句子,模型必须根据所处的空间和上下文线索定位看不见的或未指定的目标。在最先进的 VLM 中,即使观察者视角定位是明确的,通过定向语言定位目标仍然具有挑战性。我们发现观察者相关的空间推理的显式分解可以改善目标定位。我们的项目页面位于 https://mimo-owl.github.io/POVBench/。