论文

GeoWorld-VLM:视觉语言模型的世界模型几何

GeoWorld-VLM: Geometry from World Models for Vision-Language Models

摘要

现代视觉语言模型 (VLM) 实现了强大的语义识别,但在基本空间关系(例如左、上、后和之间)方面仍然很脆弱。造成这种失败的原因之一是在语言推理开始之前出现:视觉通路可能会在特征提取过程中压缩或丢弃关键的 3D 结构线索,因此语言模型接收到的图像表示已经不足以进行可靠的空间判断。我们引入了 GeoWorld-VLM,这是一个 VLM 端 蒸馏 框架,可将几何结构从冻结的摄像机条件视频世界模型转移到 VLM 中。 GeoWorld-VLM 仅微调图像编码器和多模式投影仪,将投影仪后图像特征与中间世界模型表示对齐,同时保持主干网冻结。给定图像、提示和采样的相机轨迹,世界模型教师将静态视觉输入转换为合成的多视图空间信号。训练结合了空间答案监督、师生特征对齐以及原始 VLM 的保存锚点。由于语言模型保持冻结状态,GeoWorld-VLM 保留了原始模型的语言功能,同时将空间改进归因于增强的视觉路径。为了评估所提出方法的有效性和通用性,我们将 GeoWorld-VLM 应用于两个不同的 VLM 架构,并观察两个主干网的一致改进。 GeoWorld-VLM 在 What'sUp 和 VSR 基准上的性能提高了约 4%,这表明世界模型引导的视觉对齐可以跨模型结构和空间推理数据集进行推广。