论文
让几何对于空间推理很重要
Make Geometry Matter for Spatial Reasoning
摘要
在大规模训练的支持下,视觉语言模型(VLM)实现了强大的图像和视频理解,但它们在静态场景和动态视频中执行空间推理的能力仍然有限。最近的进展尝试通过将预训练的 3D 基础模型中的几何标记注入 VLM 来解决此限制。然而,我们观察到,在这一工作中,标准 微调 后的朴素词元融合常常使此类几何线索在空间推理中未得到充分利用,因为 VLM 往往严重依赖 2D 视觉线索。在本文中,我们提出了 GeoSR,这是一个旨在通过鼓励 VLM 积极使用几何标记进行推理来使几何变得重要的框架。 GeoSR 引入了两个关键组件:(1)几何释放掩蔽,它在训练期间策略性地掩蔽部分 2D 视觉标记,以削弱非几何捷径并迫使模型参考几何标记进行空间推理; (2) 几何引导融合,一种门控路由机制,可自适应地放大几何证据至关重要的区域中的几何词元贡献。这些设计共同释放了几何标记在空间推理任务中的潜力。对静态和动态空间推理基准的大量实验表明,GeoSR 始终优于先前的方法,并通过有效利用几何信息建立了新的最先进的性能。该项目页面位于 https://suhzhang.github.io/GeoSR/。