论文

视觉敏感性不等于可伸缩性:多模态强化学习的持久性感知信用分配

Visual sensitivity is not claim retractability: persistence-aware credit assignment for multimodal reinforcement learning

模型训练强化学习RLVR

摘要

具有可验证奖励的强化学习(RLVR)已扩展到大型视觉语言模型(LVLM),感知感知方法进一步鼓励政策依赖视觉证据。然而,依赖图像并不能保证视觉主张得到它的支持。在 RL 训练之前,Qwen2.5-VL-7B 在四个多模态推理基准上正确回答的响应中有 27.81% 包含至少一个图像不支持的直接视觉主张。由于结果级强化学习将每个响应作为一个整体进行奖励,因此这些主张继承了正确答案的积极信用。我们引入了一种固定rollout的反事实诊断,可以在干预图像下重新对相同的响应进行评分,以分离证据函数敏感性(EFS)、模型的预测变化的强度、主张的持久性、模型是否继续支持相同的主张而不是撤回它。诊断揭示了敏感性-持久性解耦(SPD):在 DAPO 和 VPPO 下,EFS 增加,索赔总体上变得更加可撤销,但不受支持的索赔变得更加持久,而 GRPO 提高了 EFS 而没有这种恶化。因此,我们提出持久感知信用门控(PACG),它会削弱异常持久的视觉声明的积极信用,并保持所有其他信用不变。它不需要支持/不支持的标签,并且不会增加推理成本。在 Qwen2.5-VL-7B 上,PACG 使用 DAPO 将三个种子的九个基准平均值从 58.1% 提高到 59.9%,使用 VPPO 从 59.8% 提高到 60.9%,同时使不受支持的声明更容易撤回。收益扩展到更大的模型、更新的主干网,并且 HallusionBench 的准确性也持续提高。这些结果表明,视觉敏感性和索赔可撤销性是多式联运信用分配的互补维度。