论文
SIVA-RL:面向多模态强化学习的敏感性与不变性视觉对齐
SIVA-RL: Sensitivity-Invariance Visual Alignment for Multimodal Reinforcement Learning
摘要
具有可验证奖励的强化学习(RLVR)驱动多模态推理,但答案级别的正确性并不能保证视觉语言模型将其预测建立在视觉证据的基础上。现有的视觉干预方法将原始图像和修改图像上的策略行为进行对比,但根据干预类型而不是其观察到的效果来分配监督。这个假设失败了:相同的算子在样本之间产生异质的结果。我们提出了 SIVA-RL,一种敏感性与不变性视觉对齐框架,用样本方面的、结果条件的监督取代了算子条件的正则化。 SIVA-RL 通过标记对齐、距离受限的图像内 PatchSwap 构建局部干预。然后,冻结的审计策略对每个干净干预对进行评分,观察到的奖励下降变成软路由权重。大落差对驱动灵敏度对齐,低落差对驱动干净锚定不变性对齐,而模糊对则降低权重。该设计将干预构建与监督分配分离,并且与 GRPO 和 DAPO 主干网兼容。在跨越数学、逻辑和视觉相关任务的九个多模态推理基准中,SIVA-RL 在每种设置中都比匹配的 RL 基线改进了 3B 和 7B 模型。它在视觉依赖推理方面提高了 8.79 个百分点,在所有四种基于 GRPO 和 DAPO 的配置中相对整体提高了高达 14.9%。