论文

想象感知token增强多模态语言模型的空间推理

Imaginative Perception Tokens Enhance Spatial Reasoning in Multimodal Language Models

模型训练监督微调与指令调优

摘要

视觉语言模型(VLM)在许多任务上表现出色,但当关键信息无法直接观察时,仍然难以进行空间推理。许多此类问题需要富有想象力的感知:推断从看不见的视点会看到什么,追踪穿过封闭空间的路径,或者将部分观察结果整合到连贯的空间表示中。我们引入了想象力感知令牌(IPT),这是一种中间感知表示,可以将 VLM 在替代空间配置下感知的内容具体化,同时与观察到的输入保持一致。为了研究这种能力,我们制定了三项任务:视角采择 (PET)、路径追踪 (PT) 和多视图计数 (MVC),并构建了包含大约 20K 个示例的数据集,其中包含真实的想象、答案和评估基准。使用统一的 VLM BAGEL 作为骨干,IPT 监督持续改进空间推理,并且通常优于文本思维链训练,即使在推理时不生成图像。在MVC上,IPT将准确率提高了3.4%,并在PT上实现了与强大的闭源模型竞争的性能。我们进一步发现,将 IPT 和仅标签监督相结合会产生额外的收益,而文本思想链会大大降低性能,这表明当通过语言强制进行空间计算时会出现模态不匹配。总的来说,IPT 提供了一个有原则的监督信号,用于推理未观察到的空间结构,提高泛化能力,同时产生可解释的中间表示。

想象感知token增强多模态语言模型的空间推理:论文配图
图 1:三个空间想象任务的概述。左栏显示具有真实想象力感知的训练示例;右栏显示评估示例。