论文

Remember-R1:通过强化学习减轻长上下文视觉遗忘

Remember-R1: Mitigating Long-Context Visual Forgetting through Reinforcement Learning

模型训练强化学习

摘要

多模态 大语言模型 (MLLM) 越来越依赖于复杂任务的长链思维推理。然而,随着推理序列的延长,模型可能会逐渐减少对视觉证据的依赖,而更多地依赖积累的文本上下文,从而导致视觉遗忘。现有的方法并不直接限制如何沿着原始推理轨迹使用和维护视觉证据,导致长上下文视觉遗忘没有得到充分解决。为了解决这个问题,我们提出 Remember-R1,这是一种强化学习框架,通过直接在原始推理轨迹上应用过程级监督来减轻长上下文视觉遗忘。具体来说,Remember-R1 引入了奖励,鼓励更广泛地覆盖匹配的视觉关键词,在后续推理步骤中增强视觉依赖性的持久性,并更加关注与问题相关的图像区域。跨多个模型规模和不同多模态基准的实验表明,Remember-R1 持续提高推理性能。其他分析进一步表明,它减缓了生成过程中视觉注意力的下降,支持其在减轻长上下文视觉遗忘方面的有效性。