论文
空间思想链:视觉语言模型的模态不可知空间基础
Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models
摘要
空间理解是实体智能的基础,是机器人操作、实体导航和自动驾驶等应用的基础。尽管最近的视觉语言模型(VLM)在空间推理基准上取得了令人印象深刻的性能,但最先进的方法通常在推理过程中依赖于额外的空间编码器或架构修改,从而增加了计算成本。我们引入了 Space Tokens,这是一个轻量级的、与架构无关的框架,它为 VLM 配备了显式的连续空间表示,而不需要额外的推理时间模块。通过将场景级 3D 几何和以对象为中心的空间属性提炼为连续的潜在标记,我们的方法使这些模态能够直接纳入思想链推理过程,从而提高 VLM 的空间推理能力。同时,可以对学习到的表示进行显式解码,以验证它们是否编码了有意义的几何信息,而统一的词元接口仍然可以扩展到其他模态。 VSI-Bench 上的实验将 Qwen3-VL-8B 提高了 4.3%,将 SenseNova-SI-1.3 提高了 1.3%,同时在对象尺寸(79.2%)和房间尺寸估计(75.7%)方面实现了最先进的性能。这些结果表明,连续空间标记提供了一种有效的、可解释的和计算高效的机制,用于将几何推理集成到大型视觉语言模型中。