论文
自洽潜在推理:视觉语言模型的长潜在序列推理
Self-Consistent Latent Reasoning: Long Latent Sequence Reasoning for Vision-Language Model
摘要
在语言推理中,较长的思维链始终会产生更好的性能,这自然表明视觉潜在推理可能同样受益于较长的潜在序列。然而,我们发现了一个违反直觉的现象:随着潜在序列变长,现有潜在视觉推理方法的性能会系统性地下降。我们揭示了根本原因:信息增益崩溃——自回归生成使每个步骤高度依赖于先前的输出,因此后续词元几乎无法引入新信息。我们进一步发现,用作监督目标的大量池化($\geq 128\times$)图像嵌入所提供的信号并不比无意义的占位符更多。受这些见解的启发,我们提出了 SCOLAR(自一致 LAtent Reasoning),它引入了一种轻量级解变换器,利用 LLM 的全序列隐藏状态在单个镜头中生成辅助视觉标记,每个标记独立锚定到原始视觉空间。结合三阶段 SFT 和 ALPO 强化学习,SCOLAR 将可接受的潜在 CoT 长度延长了 30 美元以上,在现实世界推理基准上实现了开源模型中最先进的水平(比骨干网高出 14.12%),并表现出强大的分布外泛化能力。