论文

3D 图元是 VLM 的空间语言

3D Primitives are a Spatial Language for VLMs

模型推理推理策略与问题分解

摘要

视觉语言模型 (VLM) 表现出一个惊人的悖论:它们可以生成可执行代码,根据具有正确对象计数、类别和近似位置的几何基元重建 3D 场景,但相同的模型却无法解决同一图像上的更简单的空间问题。我们展示了 3D 几何基元(立方体、球体、圆柱体,以可执行代码表示)可以作为空间理解的强大中间表示,并通过三个贡献来利用它。首先,我们介绍 \textbf{\textsc{SpatialBabel}},这是一个基准测试,评估 14 个 VLM 在六种 \emph{场景代码语言}(3D 原始场景的编程语言和声明格式)中基于原始的 3D 场景重建的情况,揭示了单个模型的对象检测 F1 在不同语言之间的差异可达 $5.7\times$。其次,我们提出 \textbf{Code-CoT} (代码思想链),这是一种 无需训练 推理策略,通过基于原语的代码生成来路由空间推理。对于具有强大编码能力的 VLM,Code-CoT 在原始场景上将 SpatialBabel-QA-Score 提升了高达 $+6.4$\%,将真实照片 CV-Bench-3D 精度提升了 $+5.0$\%。第三,我们提出 \textbf{S$^{3}$-FT} (自监督空间 微调),它通过将模型自己的 Three.js 原始重建解析为结构化注释和结果上的 微调 来自监督地将原始空间知识提炼为一般视觉推理,其中 \emph{没有人类标签,没有教师模型}。仅对原始图像进行训练,S$^3$-FT 在 SpatialBabel-Primitive-QA 上将 Qwen3-VL-8B 提高了 $+4.6$ 至 $+8.6$\%,在 CV-Bench-2D 上提高了 $+9.7$\%,在 HallusionBench 上提高了 $+1​​7$\%;该配方可以跨模型系列转移。这些结果在代码中建立了几何基元作为 VLM 的诊断和可转移空间词汇。我们将在发布后发布所有工件。