论文

哪种预训练范式更好地服务于空间智能?视觉语言和视频生成模型的实证比较

Which Pretraining Paradigm Better Serves Spatial Intelligence? An Empirical Comparison of Vision-Language and Video Generation Models

模型评测模型行为与机制分析

摘要

空间智能需要视觉表示来捕获物理世界中的语义对象和几何结构。为了支持这一点,现在广泛使用两种主要的 预训练 方案作为基础骨干:视觉语言模型 (VLM),它使用语言监督来使视觉观察与语义概念保持一致;视频生成模型 (VGM),它从随时间变化的视觉世界中学习。然而,目前尚不清楚哪种 预训练 方案为空间智能提供了更好的表示基础。在本文中,我们提出了第一个针对空间智能的三个代表轴的 VLM 和 VGM 的系统性冻结特征探测研究:语义标记、实例分组和 3D 几何预测。使用轻量级探针,我们的框架可以对两个模型系列的冻结表示中已编码的信息进行受控比较。实验结果揭示了明显的互补性:VLM 在语义标记和实例分组方面更强,而 VGM 为密集几何和相机运动提供了更容易访问的信号。此外,两者的简单融合已经产生了一种在几何和语义方面都表现出色的表示,这表明通过有效集成两个模型系列的特征来构建更强大的空间智能骨干的有前途的方向。我们的代码可在 \href{https://github.com/om-ai-lab/Probing-VLM-VGM}{https://github.com/om-ai-lab/Probing-VLM-VGM} 获取。