论文
World2VLM:将世界模型想象力提炼为 VLM 以进行动态空间推理
World2VLM: Distilling World Model Imagination into VLMs for Dynamic Spatial Reasoning
摘要
视觉语言模型(VLM)在静态视觉理解方面表现出了强大的性能,但它们仍然难以进行动态空间推理,这需要想象场景在以自我为中心的运动下如何演变。最近的努力要么通过使用合成数据扩展空间监督,要么通过在推理时将 VLM 与世界模型耦合来解决这一限制。然而,前者通常缺乏运动条件状态转换的显式建模,而后者会产生大量的计算开销。在这项工作中,我们提出了 World2VLM,这是一个将空间想象力从生成世界模型提炼为视觉语言模型的训练框架。给定初始观察和参数化相机轨迹,我们使用视图一致的世界模型来合成几何对齐的未来视图,并为正向(动作到结果)和逆向(结果到动作)空间推理导出结构化监督。我们在该管道生成的紧凑数据集上使用两阶段配方对 VLM 进行后训练,并在多个空间推理基准上对其进行评估。 World2VLM 在不同的基准测试中对基本模型进行了一致的改进,包括 SAT-Real、SAT-Synthesized、VSI-Bench 和 MindCube。它还优于测试时世界模型耦合方法,同时消除了昂贵的推理时生成的需要。我们的结果表明,世界模型不仅可以充当推理时间工具,还可以充当有效的训练教师,使 VLM 能够以可扩展且高效的方式内化空间想象力。