论文

让几何引导:多模态中几何先验的分层展开 LLM

Let Geometry GUIDE: Layer-wise Unrolling of Geometric Priors in Multimodal LLMs

模型架构Transformer

摘要

多模态 大语言模型 (MLLM) 在 2D 视觉任务中取得了显着进展,但仍然难以理解现实世界视觉流中的物理空间。最近,从视觉输入中隐式提取几何先验的前馈几何基础模型提供了一个有希望的方向。然而,许多现有的几何感知 MLLM 从单个深度编码器层提取特征,并在语言模型输入处执行一次性融合,可能会忽略几何编码器层之间的补充信息,限制对细粒度几何线索的访问,并阻碍渐进的跨模式适应。为了解决这些限制,我们提出了 GUIDE(MLLM 早期层内的几何展开),这是一种用于集成几何先验的渐进框架。 GUIDE 对来自几何编码器的多级特征进行采样和对齐,然后将它们依次注入到 MLLM 的早期层中。这种设计使 MLLM 能够连续访问多粒度几何线索,并在分层语义抽象过程中逐步将它们与视觉表示集成。 GUIDE 进一步在词元和层级别引入了双重上下文感知门控机制,有选择地调节几何信息以减少冗余注入和对预训练表示的干扰。针对空间推理和 3D 场景理解基准的大量实验(包括 VSI-Bench、ScanRefer 和 Scan2Cap)验证了 GUIDE 的有效性和跨任务适用性。我们的 5B 和 9B 模型在 VSI-Bench 上的平均得分分别为 71.5 和 72.1。