论文
SPACENUM:重新审视VLM的空间数值理解
SPACENUM: Revisiting Spatial Numerical Understanding in VLMs
摘要
视觉语言模型(VLM)越来越多地被部署到具身环境中,需要产出动作幅度、空间坐标等数值输出。尽管这些数字看似有意义,但这些数值输出是否真正扎根于空间感知仍不清楚。因此,本工作通过SpaceNum重新审视空间数值理解,这是一个统一框架,涵盖两种互补设定:数字作为空间探索中的动态过渡,以及数字作为空间推理中的静态布局。我们构建了两个双向任务Num2Space与Space2Num,评估VLM在视觉侧空间结构与语言侧数值表示之间的映射能力。我们系统研究了当前VLM是否真正理解空间设定下的数值。在动态过渡与静态布局两类设定中,我们发现模型大多未能将数字扎根于空间含义,表现常常接近随机猜测。通过错误分析、推理轨迹分析与受控干预,我们表明当前VLM严重依赖浅层空间线索,难以建立稳定的坐标感知表示,也无法从视觉观测中抽象出结构化空间布局。我们进一步表明,显式推理仅带来边际收益,而调优能部分改善空间数值理解,并可迁移到外部空间推理基准。
