论文
分解、查看和推理:VLM 的强化潜在推理
Decompose, Look, and Reason: Reinforced Latent Reasoning for VLMs
摘要
由于文本 CoT 中的视觉信息丢失,视觉语言模型经常难以进行复杂的视觉推理。现有方法要么增加工具调用的成本,要么依赖基于局部补丁的嵌入,而这些嵌入不足以在多步骤推理中提取语义。我们提出“分解、查看和推理”(DLR),这是一种强化的潜在推理框架,可以动态地将查询分解为文本前提,提取前提条件的连续视觉潜在,并通过有根据的基本原理推导出答案。我们引入了三阶段训练流程,并提出了一种新颖的球形高斯潜在策略,以实现对潜在空间的有效探索。以视觉为中心的基准测试的大量实验表明,DLR 始终优于强基线,包括纯文本、交错多模态 CoT 和潜在推理方法,同时提供卓越的逐步可解释性。