论文

DeepLatent:通过并行潜在视觉推理用图像进行思考

DeepLatent: Think with Images via Parallel Latent Visual Reasoning

模型推理推理策略与问题分解

摘要

新兴的“用图像思考”范式将视觉状态嵌入到中间推理步骤中,定义了视觉语言模型的新领域。现有的方法有两个分歧。工具辅助方法应用显式视觉操作,但存在高延迟和受限的操作类型。潜在推理方法自回归产生隐式视觉状态,但表现不佳工具辅助方法,并且它们的潜在标记无法捕获有效的视觉信息。在这项工作中,我们提出了 DeepLatent,一种用于潜在视觉推理的并行框架。首先,我们介绍一下LatentFormer。它使用可学习的 2D 标记并行生成上下文条件的潜在状态,将每个视觉更新直接锚定在原始图像特征中。其次,我们设计了连续空间强化学习算法。它直接在嵌入空间中优化潜在调制参数,显着提高潜在表示质量。该框架通过 知识蒸馏 进行训练,然后使用连续空间 RL 算法。此外,我们还贡献了 DeepLatent-180K,这是一个为潜在视觉推理量身定制的大型数据集。跨多个基准的广泛评估表明 DeepLatent 实现了最先进的性能。