论文
相同的奖励,不同的技能:当多模态强化学习学会观察时
Same Reward, Different Skills: When Multimodal RL Learns to Look
摘要
即使在训练期间没有视觉信息,具有可验证奖励的强化学习(RLVR)也可以提高视觉语言基准分数。对于测试图像,盲训练模型在 3B 时恢复了大约一半的真实图像增益,在 7B 时恢复了近五分之四。长时间的真实图像训练可能会削弱基础,而基准增益仍然存在。这两项发现都暴露出相同的差距:提示中的图像不是学习信号中的图像。我们的设计规则“视觉分辨率”要求视觉证据对于正确答案是必要的,并且任务仍然是可学习的。我们在反事实坐标场景中进行测试,其中问题保持固定并且目标从未被命名,因此正确的答案需要在图像中找到目标。借助标准 GRPO 和正确性和格式奖励,7B 模型在比其训练过的任何场景都更密集的保留场景上,将其寻找目标(发现)的准确性从 0.425 提高到 0.875,并且改进了从未训练过的问题类型。两个控件定位增益源。用灰色画布替换测试图像会将发现率降至零;相反,在匹配步骤 30 和四个种子中的每一个中,在灰色画布上进行训练基本上不会产生任何增益,即使模型随后用真实图像进行测试也是如此。学到的技能可以延续到独立于训练语料库构建的基础任务中。回答训练问题的标题,添加到相同的图像、奖励和预算中,将收益减少了近三分之二。改变奖励需要改变强化学习的内容。