论文

用于多视图空间理解的搜索和视图推理

Seek-and-View Reasoning for Multi-View Spatial Understanding

模型推理应用与实践推理搜索与路径规划视觉感知与空间理解

摘要

现有的多视图空间推理方法主要在稀疏输入视图上运行。因此,视觉语言模型(VLM)仅限于理解场景并推断这些固定视图内的空间关系,从而导致脆弱的跨视图对齐和几何到语言的瓶颈。为了解决这些问题,我们制定了一种新颖的“寻求和查看”推理方法,通过定位与问题相关的视图来支持空间推理,从而找到隐含的跨视图空间证据。为了实现这种方法,我们提出了 Vantage,这是一种免训练的模型不可知推理框架,它将 VLM 与 3D 基础模型配对:用于问题分析和视图规划的基于视点的推理阶段,然后是基于几何的证据增强阶段,以有效地综合视觉证据并将其纳入最终推理。对六个 VLM 的综合实验表明,无需微调即可在五个基准上实现一致改进。总体而言,通过基于视图的推理揭示空间证据,Vantage 可以很大程度上减少对基于语言的依赖 跨视图对齐并提高多视图空间理解。我们的代码可在 https://github.com/q1xiangchen/Vantage. 获取