论文

GLaQ:为多模态推理奠定视觉证据中的潜在查询

GLaQ: Grounding Latent Queries in Visual Evidence for Multimodal Reasoning

模型架构Transformer

摘要

思维链推理极大地提高了多模态 大语言模型 的问题解决能力。然而,细粒度的视觉证据仍然难以在基于文本的推理步骤中保存和重用。为了解决这一限制,工具增强的图像思维方法通过重新访问或操作图像来维持外部视觉访问,但需要预定义的工具和额外的推理时间处理。作为一种内部替代方案,连续视觉潜在推理将中间计算保留在隐藏状态。然而,其普遍的自回归结构使得每个潜在状态都依赖于其前一个状态,因此后面的状态可能会重复潜在序列中已经存在的信息,而不是捕获互补的视觉细节。我们引入了 GLaQ,一个扎根的潜在查询框架,它用一组基于原始视觉标记的固定的上下文条件查询取代了顺序潜空间采样轨迹。扎根的查询被重新注入以生成答案,从而提供对源视觉证据的直接和协调的访问。我们使用本地化视图监督来训练 GLaQ,然后在任务级奖励下进行强化学习。在细粒度视觉理解和感知的五个基准中,GLaQ-7B 比其基本模型提高了 5.99--9.66%,领先于所有比较的视觉潜在方法,这表明直接查询到图像的基础可以从完整图像中恢复局部证据,而无需外部视觉操作或自回归潜空间采样轨迹。