论文

LanteRn:潜在视觉结构化推理

LanteRn: Latent Visual Structured Reasoning

模型推理推理策略与问题分解

摘要

虽然语言推理模型在许多任务中表现出色,但视觉推理对于当前的大型多模态模型 (LMM) 仍然具有挑战性。因此,大多数 LMM 默认将感知内容语言化为文本,这对于需要细粒度空间和视觉理解的任务来说是一个很大的限制。虽然最近的方法通过调用工具或生成中间图像来思考图像,但它们要么依赖外部模块,要么通过直接在像素空间中推理而产生不必要的计算。在本文中,我们介绍了 LanteRn,这是一个框架,使 LMM 能够将语言与紧凑的潜在视觉表示交织在一起,从而允许视觉推理直接发生在潜在空间中。 LanteRn 增强了视觉语言 Transformer,能够在推理过程中生成并处理连续的视觉思维嵌入。我们分两个阶段训练模型:监督 微调 以潜在状态中的视觉特征为基础,然后进行强化学习,使潜在推理与任务级效用保持一致。我们在三个以感知为中心的基准(VisCoT、V* 和 Blink)上评估 LanteRn,观察到视觉基础和细粒度推理方面的持续改进。这些结果表明,内部潜在表示为更有效的多模态推理提供了一个有希望的方向。