论文

通过潜在状态推理:让视觉潜在推理真正参与预测

Reason Through the Latent! Making Latent Visual Reasoning Necessary

模型架构递归架构

摘要

潜在视觉推理旨在通过隐藏状态计算而不是显式文本思维链来执行多模态推理。然而,以潜在状态存在的视觉信息并不意味着模型在生成答案时实际上依赖于该状态,特别是当替代图像条件路径仍然可用时。我们引入了因果视觉循环推理(CVRR),它保留了预训练的视觉能力,同时使循环计算成为预测所需的图像条件路径。在预训练的视觉语言模型合并图像后,CVRR 从问题隐藏状态初始化递归,然后在重新读取相同的固定视觉证据时重复更新此状态。在解码之前,视觉状态和原始多模态 KV 缓存将被删除,以便只有最终的循环状态才能将图像条件信息传递给答案。在 $V^*$、MMVP、BLINK 和 MME-RealWorld-Lite 基准中,CVRR 在这种严格的接口下保留了强大的性能,而兼容的潜在推理机即使在相同约束下重新训练也无法恢复可比的视觉能力。因果干预进一步表明,当问题固定时,预测对重复出现的内容仍然敏感,并且持续的视觉证据会因果地修正重复出现的轨迹。这些结果将潜在信息性与实际用于预测的潜在计算区分开来。