论文

视觉潜在因素比他们所说的了解更多:在 MLLM 中消除潜在推理的沉默

Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs

模型推理推理策略与问题分解

摘要

连续潜在空间推理为多模态模型的文本思想链提供了一种紧凑的替代方案,无需显式推理标记即可集成高维视觉证据。然而,我们在现有潜在视觉推理方法中发现了一个先前被忽视的优化病理学:尽管视觉潜在在训练过程中在语义上变得丰富,但它们对最终答案预测的贡献被系统地抑制。在共享参数空间内,自回归目标有利于对直接视觉输入的快捷依赖,将潜在标记推向类似转换的状态,而不是信息推理内容。我们将这种现象称为“视觉潜伏沉默”。为了解决这个问题,我们通过在推理时直接优化潜在推理、保持骨干参数冻结来消除两个相互冲突的目标。在第一阶段,通过查询引导的对比潜在视觉对齐来预热视觉潜在,提高语义质量,同时防止潜在崩溃。在第二阶段,潜在推理通过置信度进展奖励得到进一步优化,这会激励沿着潜在跨度的预测词元分布逐渐变得更加集中,通过潜在推理而不是绕过它来路由预测。跨八个基准和四个模型主干的实验表明,在没有任何参数更新的情况下,推理时间潜在优化可以有效地释放被抑制的视觉潜在推理能力。