论文

SLVR:通过类人推理流程进行结构化潜在视觉推理

SLVR: Structured Latent Visual Reasoning via Human-like Reasoning Flows

模型训练模型推理监督微调与指令调优推理策略与问题分解

摘要

多模态大语言模型(MLLM)通常依靠语言先验而不是与任务相关的视觉证据来回答视觉推理问题。文本思维链推理可以通过鼓励模型将视觉问题分解为中间的证据寻求步骤来部分缓解这个问题,但生成这些步骤会增加推理成本。潜在推理避免了明确的基本原理生成,但现有方法对中间状态编码的控制有限,因此很难对规划、基础和证据选择进行单独的监督。我们提出了结构化潜在视觉推理(SLVR),这是一种训练框架,通过将多模态推理组织到用于规划、基础、证据选择和推理整合的类型化潜在阶段,来连接显式思维链和潜在推理。 SLVR 首先通过屏蔽揭示答案的文本并将正确答案与视觉上合理的干扰因素进行对比来训练模型依赖于图像。然后它将推理组织到潜在阶段 用于规划、基础、证据选择和整合,用相应的信号监督每个阶段:计划、方框、视觉证据和最终理由。这为潜在推理提供了明确的功能结构,同时避免在推理时生成文本链。 SLVR 基于 Qwen2.5-VL-7B 构建,在多模态推理基准测试中持续改进,在 MMVP 上绝对增益 +9.4,在 BLINK Relation 上绝对增益 +14.2,并且在 V*、MathVista 和 ChartQA 上也有改进。这些结果表明,结构化潜在监督可以改善细粒度的视觉推理,而无需文本 CoT 的解码开销。项目页面可用 \href{https://bogao-code.github.io/SLVR/}{here}.