论文

Evidence-RL:迈向证据密集型视觉推理

Evidence-RL: Towards Evidence-intensive Visual Reasoning

模型训练强化学习

摘要

视觉语言模型(VLM)应该根据具体的图像证据而不是语言先验、数据集快捷方式或不相关的视觉上下文来回答。现有的感知感知 后训练 方法鼓励通过全局扰动或注意力代理来使用图像,但它们不会测试采样答案是否因果地依赖于支持它的局部证据。我们提出反事实证据解开(CED),这是一种针对 VLM 基础的训练时证据审计。对于每个响应,CED 都会中和以对象为中心的证据区域,并将所得支持率下降与匹配的非证据区域进行比较。我们将此信号与 GRPO 内的答案正确性结合起来,奖励依赖证据路径而不是捷径或滋扰路径的正确答案。 CED 使用弱对象级提案,不需要针对特定​​问题的证据注释,并且不会增加推理时间开销。在九个公共基准和四个骨干网中,CED 的性能优于之前基于 RL 的 后训练 方法,并通过针对性分析验证其以对象为中心的信号。