论文
多式联运模型会想象电子羊吗?
Do multimodal models imagine electric sheep?
摘要
是的。我们发现大型多模态模型在解决空间难题时会产生心理意象,并且它们在解决羊难题时确实会想象羊。我们对 Qwen3.5 VLM 进行了微调,以解决 12 种不同的视觉推理任务,包括七巧板、拼图、推箱子、3D 心理旋转和高峰时间,这些任务需要理解几何、空间关系和动作的后果。通过监督模型预测从初始状态开始解决谜题的开环动作序列,我们表明模型在每个动作之后的激活都编码了有关中间状态的有意义的视觉信息。这一发现表明,在没有任何明确的视觉监督的情况下,不完美的视觉世界模型开始形成,作为学习选择正确动作的副产品。基于这一观察,我们提出了两种锐化和使用模型形成的心理图像的方法。我们发现,将每一步少至 16 个视觉标记集成到思维链中,可以将平均解决率从 83% 提高到 89%,尤其是在拼图和 3D 心理旋转等推理繁重的任务上,收益尤其显着。