论文

检索、整合和综合:基于空间语义的潜在视觉推理

Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning

模型推理推理策略与问题分解

摘要

多模态 大语言模型 (MLLM) 在视觉语言推理方面取得了显着进展,但大多数方法仍然将视觉证据压缩为离散的文本思维,为细粒度感知造成了信息瓶颈。最近的潜在视觉推理方法试图在连续隐藏状态下进行推理,但我们发现它们缺乏流形兼容性:潜在轨迹偏离预先训练的推理电路,崩溃成与实例无关的模式,并且在答案生成过程中经常被绕过。为了解决这些问题,我们提出了 RIS(检索、集成和综合),这是一种空间语义基础框架,可开发潜在推理作为预训练 MLLM 计算的兼容扩展。我们首先构建一个带有边界框和特定区域语义描述的逐步推理数据集。建立在这种监督的基础上,RIS 将潜在标记锚定到空间和语义证据,通过渐进式注意力瓶颈强化其因果作用,并引入短语言转换标记将合成的潜在状态桥接回词汇对齐解码。 V*、HRBench4K、HRBench8K、MMVP 和 BLINK 上的实验表明,相对于封闭/开源和潜在推理基线,有一致的改进。进一步的分析表明,RIS 可以学习多样化、可解释且逐步整合的潜在轨迹,为 MLLM 中忠实的内部视觉推理提供了一条实用途径。