论文
多模态推理的视觉引导策略优化
Visually-Guided Policy Optimization for Multimodal Reasoning
摘要
具有可验证奖励的强化学习(RLVR)显着提高了视觉语言模型(VLM)的推理能力。然而,VLM 固有的文本主导性质常常导致视觉 忠实性 不足,其特点是对视觉标记的注意力激活稀疏。更重要的是,我们的实证分析表明,推理步骤中的时间视觉遗忘加剧了这种缺陷。为了弥补这一差距,我们提出了视觉引导策略优化(VGPO),这是一种在策略优化过程中加强视觉焦点的新颖框架。具体来说,VGPO 最初引入了视觉注意力补偿机制,利用视觉相似性来定位和放大视觉线索,同时在后续步骤中逐步提高视觉期望,以抵消视觉遗忘。在此机制的基础上,我们实施了双粒度优势重新加权策略:轨迹内级别突出显示相对较高视觉激活的标记,而轨迹间级别优先考虑表现出优异视觉积累的轨迹。大量实验表明,VGPO 在数学多模态推理和视觉相关任务中实现了更好的视觉激活和卓越性能。该代码已发布于 https://github.com/wzb-bupt/VGPO。