论文
优先考虑最好的:通过超越答案正确性的奖励来激励可靠的多模式推理
Prioritizing the Best: Incentivizing Reliable Multimodal Reasoning by Rewarding Beyond Answer Correctness
摘要
带可验证奖励的强化学习 (RLVR) 通过奖励可验证的最终答案来改进多模态推理。然而,正确答案的轨迹可能仍然依赖于不完整的推导、薄弱的证据或与其结论相矛盾的陈述。答案正确性和推理有效性之间的差距(我们称之为推理-答案不一致)激发了多模态强化学习中的轨迹监督。我们比较两种主要方法:奖励模型(RM)和生成奖励(GR)。 RM 效率很高,并在早期训练中提供帮助,但随着政策分配的变化,他们的收益会减弱; GR 可以提高性能,但可能会带来不稳定的奖励并且计算成本高昂。因此,我们提出了分组排名奖励(Groupwise Ranking Reward),它将验证者通过的轨迹在一次相同的提示中进行排名,并相应地重新分配奖励。分组比较可以更好地区分更强和更弱的正确轨迹,并且比 GR 的判断开销更低。实验表明,RLVR 加剧了推理答案的不一致,而轨迹监督则缓解了这种不一致。 Groupwise Ranking Reward 总体表现最佳,与 RLVR 相比,可靠性条件下的准确度从 47.4% 提高到 54.7%。