论文

GeoWeaver:在场景推理之前用几何证据奠定视觉标记的基础

GeoWeaver: Grounding Visual Tokens with Geometric Evidence before Scene Reasoning

应用与实践视觉感知与空间理解

摘要

视觉语言模型中的时空推理需要保留物理几何形状而不仅仅是语义外观的视觉表示。最近的多模态模型通过结构分支、3D 感知监督、推理阶段融合或长视野记忆来整合几何信息。虽然这些方法证明了几何对于空间智能的重要性,但它们通常将几何线索视为所有视觉标记的共享信号。我们注意到,这忽略了一个更细粒度的挑战:不同的视觉标记根据其空间角色需要不同的几何证据。为了解决这个限制,我们引入了 GeoWeaver,一个预推理几何基础框架,它将几何视为时空推理的表征先决条件。 GeoWeaver 从冻结的几何编码器构建多级几何库,并执行词元自适应几何证据分配,使每个视觉词元能够检索最相关的几何抽象。在语言建模之前,通过残差几何证据融合操作将选定的证据合并到视觉标记中,从而为下游推理生成基于几何的表示。对空间推理基准的广泛评估表明,GeoWeaver 始终如一地增强几何感知推理,同时保留一般的多模式功能。这表明几何信息产生的最大好处不是作为后期融合辅助信号,而是作为塑造 大语言模型 执行推理的表征基础的基本先决条件。所有源代码和模型将在 https://github.com/yahooo-m/GeoWeaver 发布。