用想象力思考:使用世界模拟器进行代理视觉空间推理
Thinking with Imagination: Agentic Visual Spatial Reasoning with World Simulators
摘要
虽然视觉语言模型(VLM)显示出强大的视觉推理能力,但它们的空间推理能力仍然很大程度上受限于观察到的图像和面向文本的思维链。当只有有限的以自我为中心的观察可用时,他们经常很难推断出未观察到的布局,保持交叉视图的一致性,并从不同的角度进行推理。在这项工作中,我们将这个问题作为想象思维来研究,其中 VLM 在推理过程中通过与世界模拟器交互来主动获取想象的视觉证据。我们提出了 Astra,一种代理空间推理框架,赋予 VLM 以动作条件的视觉想象力。具体来说,Astra 将 Astra-VL(一种经过 RL 训练的 VLM 策略)与 Astra-WM(一种基于 Bagel 的世界模拟器)结合起来,该模拟器可以根据上下文图像和自然语言相机运动生成新颖的视图观察结果。为了提供可靠的想象证据,Astra-WM 通过视图一致性调整进行训练,以提高跨视图的姿势和内容一致性。在强化学习阶段,我们提出了一种世界模拟器循环两阶段强化学习课程,以稳定工具使用探索,并仅当想象的观察比直接回答有所改善时,才能提高模型调用模拟器的能力。实验表明,世界模拟器和代理策略都是必要的:Astra-WM 将 MMSI-Bench 上的模拟器增强型 Gemini-3-Flash 从 45.1 提高到 49.5,而 Astra-VL 将 MMSI-Bench 上的 Qwen3-VL 主干从 29.8 提高到 38.8,在 MindCube 上从 36.8 提高到 42.7。这些结果表明,想象的观察可以提供有用的空间证据,但有效的世界模型增强推理需要学习何时、何地以及如何想象。