论文

Faithful GRPO:通过约束策略优化改进多模态语言模型中的视觉空间推理

Faithful GRPO: Improving Visual Spatial Reasoning in Multimodal Language Models via Constrained Policy Optimization

模型训练强化学习

摘要

经过可验证奖励强化学习 (RLVR) 训练的多模态推理模型 (MRM) 在视觉推理基准上显示出更高的准确性。然而,我们观察到,准确性的提高通常是以推理质量为代价的:生成的思维链(CoT)痕迹经常与最终答案不一致,并且缺乏视觉证据的基础。我们通过七个具有挑战性的现实世界空间推理基准系统地研究了这一现象,发现它影响当代 MRM,例如 ViGoRL-Spatial、TreeVGR 以及我们自己使用标准组相对策略优化 (GRPO) 训练的模型。我们沿着两个互补的轴描述 CoT 推理质量:“逻辑一致性”(CoT 是否包含最终答案?)和“视觉基础”(每个推理步骤是否准确描述图像中的对象、属性和空间关系?)。为了解决这个问题,我们提出了 Faithful GRPO (FGRPO),它是 GRPO 的一种变体,通过拉格朗日双上升来强制一致性和基础作为约束。 FGRPO 将批次级一致性和基础约束纳入组内的优势计算中,在优化过程中自适应调整约束的相对重要性。我们在七个空间数据集的 Qwen2.5-VL-7B 和 3B 主干上评估 FGRPO。我们的结果表明,FGRPO 显着提高了推理质量,将不一致率从 24.5% 降低到 1.7%,并将视觉基础分数提高了 13%。与简单的 GRPO 相比,它还提高了最终答案的准确性,表明忠实的推理可以带来更好的答案。