论文
视觉语言模型能理解 3D 场景还是只能理解对象目录?
Do Vision-Language Models Understand 3D Scenes or Just Catalogue Objects?
摘要
视觉语言模型可靠地命名场景中的对象,但它们是否代表这些对象所在的 3D 布局?我们引入了一个由 3,034 个样本组成的人工基准测试,针对空间理解的三个组成部分:深度有序遮挡(通过三个独立的反事实操作进行探测)、可见反射的光学几何推断以及体积重排规划。六个前沿和开放权重 VLM,由受过训练的注释者对 18,204 个响应进行评分,没有 LLM 作为评判,揭示了一种尖锐的分离:在可见布局上规划重新排列的准确度为 53--97%,并且很少违反碰撞约束的模型在遮挡时下降到 6--45%,在反射时下降到 7% 以下。具身推理模型再现了相同的情况。 Qwen3-VL-8B-Thinking 上的白盒分析定位了视觉词元合并的失败:整个视觉编码器可恢复的空间信息在词元压缩后变得不可访问,并且只有在将干净的合并后激活修补到语言解码器中时才再次稳定。