论文
PRPO:通过 词元级 动态优势重塑进行感知强化策略优化
PRPO: Perception-Reinforced Policy Optimization via Token-Level Dynamic Advantage Reshaping
摘要
带可验证奖励的强化学习(RLVR)已成为提高大视觉语言模型(LVLM)推理能力的有效范例。然而,现有的 RLVR 方法主要依赖于轨迹级结果奖励,它在所有生成的词元上分配相同的学习信号。这种粗粒度的贡献分配从根本上与多模态推理不匹配,在多模态推理中,只有稀疏的标记子集以视觉证据为因果基础。因此,这些关键的感知标记受到的监督较弱,并且经常被语言先验或推理模板标记所淹没。为了解决这个限制,我们提出了感知强化策略优化(PRPO),这是一个 词元级 强化学习框架,它可以明确识别和强化长视野多模态推理轨迹中的关键感知标记。 PRPO 引入了鲁棒视觉依赖性(RVD),这是一种原则性指标,用于识别预测既具有视觉基础又具有扰动稳定的标记,从而过滤掉脆弱或嘈杂的视觉标记。基于 RVD,我们进一步提出感知优势重塑(PAR),这是一种 词元级 贡献分配技术,可以放大感知信息标记,同时保留非感知标记的稳定梯度。对七个多模态推理基准的大量实验表明,PRPO 在 3B 和 7B 模型尺度上始终优于强大的 LVLM 基线,分别实现了 23.3% 和 21.1% 的平均增益。 PRPO 通过提高训练效率和更强的跨任务泛化能力实现了最先进的性能。我们的研究结果强调了细粒度学分分配对于可扩展的多模式强化学习的重要性。