论文

如何想象以及想象什么?用于跨视图空间推理的统一多模态模型中的视觉思维

How and What to Imagine? Visual Thinking in Unified Multimodal Models for Cross-View Spatial Reasoning

模型推理推理策略与问题分解

摘要

跨视图空间推理仍然是视觉语言模型(VLM)的一个弱点:它们用语言进行推理并丢弃任务所需的细粒度几何图形。用图像思考旨在通过生成中间思维图像来解决这个问题,但最近的研究表明,这些痕迹中的视觉证据在很大程度上被忽视了。因此,我们要问如何让视觉思维变得重要,以及哪种视觉思维效果最好。我们针对原生支持交错图像文本生成的统一多模态模型 (UMM) 提出这些问题。对于如何实现,我们提出了 View Dropout (VDrop),这是一种训练时干预,它将部分输入视图从答案范围中隐藏起来,同时使其对思维图像标记可见。这会激励模型在回答时使用思维图像,而不是仅根据输入视图进行回答。随着思维图像现在被用于答案预测,我们要问哪种视觉思维效果最好。我们将其视为可学习性与信息性(L-I)的权衡,并比较了三种思维图像变体:自上而下、全景和点匹配渲染。 VDrop 的全景视觉思维经过合成场景的训练并根据五个真实世界的域外基准进行评估,是唯一同时提供信息和可学习的配置,并实现了最佳的域外泛化。