论文
关注证据:多模式 RLVR 的证据锚定空间注意力监督
Attend to Evidence: Evidence-Anchored Spatial Attention Supervision for Multimodal RLVR
摘要
具有可验证奖励的强化学习 (RLVR) 通过优化从最终答案得出的结果奖励来改进视觉语言模型 (VLM)。然而,这种仅结果奖励并不能告诉模型哪些图像区域证明答案是合理的。对于需要视觉基础的问题,这些奖励无法区分相关视觉证据支持的答案与语言先验捷径或幸运猜测产生的答案。我们引入了 EASE(证据锚定空间注意力),它通过视觉证据过程监督增强了多模式 RLVR。 EASE 将带注释的证据区域转换为平滑的视觉标记目标,并用它来指导 RL 训练期间对图像注意力的响应,但仅限于高奖励轨迹。注释仅用作特权训练标签,而推理仅需要原始图像和问题。在 Qwen2.5-VL-7B、Qwen3-VL-4B 和 Qwen3-VL-8B 中,EASE 在感知、幻觉、视觉数学和多模态推理基准方面的平均得分比 DAPO 提高了 2.5 至 3.1 分。诊断和消融表明,EASE 可以更好地将视觉注意力与带注释的证据区域结合起来。