论文
Uruqi:从视觉体验中学习空间认知
Uruqi: Learning Spatial Cognition from Visual Experience
摘要
空间智能需要在实体移动时保持对世界的连贯理解。与人类一样,智能体必须使用自己的运动来解释观察结果的变化,并相应地更新对象位置和空间关系。尽管空间后训练极大地拓宽了视觉语言模型(VLM)的空间智能,但它们仍然在两个原子空间能力上苦苦挣扎:跟踪自身运动和在运动过程中绘制周围世界的地图。为了解决这一差距,我们在每个训练集中对交错的原子能力提供密集的多轮监督,模仿不断移动的智能体在观察时进行推理的视觉体验。为了扩大规模,我们在广泛的 3D 场景中合成了 11,738 个主题驱动的相机轨迹,支持自运动跟踪、持久对象映射以及每种视觉体验中丰富的空间操作。通过训练模型来推理这些原子问题,我们的 URUQI$_{Syn}$-8B 在我们的 Uruqi 基准测试中将准确性从 15.84% 提高到 47.73%,该基准包含 2.7k 个剧集中的 52k 个问题。 URUQI-SI-Mix-8B 进一步达到 50.41%,与 GPT-6 Astra 达到的 50.08% 相当。仅根据我们的合成数据进行训练,URUQI$_{Syn}$-8B 在三个外部空间基准上比其 InternVL3-8B 主干网平均相对准确度提高了 17.13%。这些结果强调了连续视觉体验是 VLM 中发展空间认知的可扩展监督来源。