论文

SpatioLM:在视觉语言模型中迈向通用物理空间智能

SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models

模型训练参数高效训练

摘要

视觉语言模型 (VLM) 在常识推理任务上表现良好,但在视觉空间推理方面表现不佳。大多数现有解决方案都会引入额外的 3D 先验输入或外部空间编码器,这会增加复杂性并降低空间 微调 后底层 VLM 的通用功能。为此,我们提出了一种参数高效的 \textit{\textbf{Spatio}-vision \textbf{L}anguage \textbf{M}odels (SpatioLM)},无需额外的 3D 先验输入或第三方空间编码器即可增强空间智能。具体来说,我们设计了一个即插即用且非侵入性的空间视觉模块,它可以引出 VLM 固有的空间知识。此外,我们创新性地利用伪深度和相机信息作为监督来指导模型学习物理相干表示。大量实验表明,SpatioLM 在空间感知和理解等多种任务中取得了显着改进,同时有效限制了一般能力的下降。值得注意的是,该模型在 VSI-Bench 上取得了令人印象深刻的 71.6 分(第一个超过 70 分的模型)。此外,当转移到具体操作任务时,它还获得了有竞争力的性能。代码可在 \href{https://github.com/xiaomi-research/spatio-lm}{\faGithub~spatio-lm} 获取。