论文

差异反馈:为 VLM 强化学习生成多模式过程级监督

Difference Feedback: Generating Multimodal Process-Level Supervision for VLM Reinforcement Learning

模型训练奖励建模与过程监督

摘要

视觉语言模型 (VLM) 通过组相对策略优化 (GRPO) 式训练日益一致。然而,仅仅依靠最终结果奖励会在多步骤推理中产生稀疏的贡献归因,削弱视觉证据和中间步骤之间的联系,并且常常导致不稳定的优化和视觉幻觉。我们提出了差分反馈,它通过修复错误的推理轨迹来自动构建词元/步骤级监督掩模,明确标记需要纠正的关键位置。无需昂贵的大规模逐步人工注释,我们的方法就可以实现流程级视觉对齐,并且可以无缝集成到现有的类似 GRPO 的框架中。在 MMMStar 和 MathVista 等多模态推理基准上进行的实验表明,在匹配的计算预算下,平均提高了 3%。我们的方法为准确的视觉推理过程调整提供了有效、低成本的解决方案。