论文
长链多模态推理中传播感知视觉保留的反射锚
Reflection Anchors for Propagation-Aware Visual Retention in Long-Chain Multimodal Reasoning
摘要
长思维链(CoT)推理改善了大型视觉语言模型,但视觉信息在生成过程中通常会消失,限制了长视野多模态推理。现有的方法要么在推理中重新注入视觉,要么训练策略以获得更强的基础,但在哪里进行干预依赖于感知启发法而不是原则性增益分析,并且局部视觉影响力如何传播仍然是隐含的。我们从信息论的角度研究这个问题,并得出一步干预的下游视觉增益的下限,这表明了两个因素:局部分支空间(词元熵)和下游视觉传播潜力(与视觉边缘化参考的后缀发散)。在此分析的指导下,我们提出了反射锚策略优化(RAPO),这是一种基于 GRPO 的策略优化方法,该方法选择高熵反射锚并优化下游视觉依赖性的链屏蔽有限窗口 KL 代理。对推理密集型和通用领域基准的实验表明,RAPO 在跨多个 LVLM 主干的强大基准上提供了显着的收益。机制分析进一步表明,反射锚针对视觉敏感决策点而丰富,并且 RAPO 沿着生成的轨迹增加了对比视觉依赖性信号。