论文
可靠的多模态强化学习的排名感知校准
Ranking-Aware Calibration for Reliable Multimodal Reinforcement Learning
摘要
强化学习 后训练 极大地提高了视觉语言模型的推理准确性,但由此产生的策略仍然校准不佳。终端正确性奖励没有提供比不确定错误更多地惩罚自信错误的梯度,也没有将置信度与视觉证据的质量联系起来的信号,这种差距在损坏或模糊的输入下变得尤其严重,因为模型继续报告对错误答案的高置信度。我们引入了排名感知校准(RAC),这是一种训练时框架,它使用基于组的 RL 已经生成的两个比较信号来监督置信度,而无需额外的标记成本。排名感知组损失强制要求在同一提示中,更好的采样轨迹比较差的采样轨迹获得更高的置信度。干净-损坏的成对损失强制信心随着视觉证据的退化而减弱。由于排名信号迫使策略区分正确和不正确的推理路径,因此它还增强了任务的准确性,超出了正确性奖励本身所产生的效果。这两种损失都不需要外部置信度注释,并且可以与基于组的 RL 后训练 自然集成。我们在 Qwen2.5-VL 和 InternVL-3.5 主干上实例化 RAC,并在干净和损坏的输入下对六个多模态推理基准进行评估。经验结果表明,排名感知损失通过教导策略区分更好和更差的推理来显着提高任务准确性,而成对腐败损失则减少了退化输入下的校准误差。它们的组合在所有测试的骨干网中实现了最佳校准,同时提高了大多数设置的准确性。