论文

提升多模态RLVR的泛化鲁棒性

Improving Generalization Robustness of Multimodal RLVR

模型训练强化学习RLVR

摘要

可验证奖励强化学习(RLVR)能提升多模态大语言模型的准确率,但收益脆弱:仅改写问题或更换提示词模板就会使其性能下降,这危及在医疗VQA等高风险场景的可靠部署。我们将其追溯到标准强化学习目标的两个问题。其一,二元验证器将格式与内容混为一谈,奖励信号无法区分答案错误与格式错误。其二,训练分布只覆盖模型部署时可能遇到的真实提示词的一小部分,因此在训练分布上表现良好的策略,在测试中遇到未见提示词时可能表现不同。这两类失败都呼唤一种稳健的后训练方法,帮助策略覆盖更广的语义等价提示词分布,我们确定了两项有助于此的措施:在奖励中分离格式与语义,以及对语义等价的扰动提示词施加策略不变性。为此我们提出提示词不变RLVR(PIRL),由动态三值奖励与基于嵌入空间对抗的一致性正则组成。压力测试下,PIRL在基准上的平均准确率仅下降≤1%,而GRPO下降约3%。在动态评估上,PIRL同样取得最小的性能降幅。

提升多模态RLVR的泛化鲁棒性:论文配图
图1:标准RLVR(红色)在训练格式提示上优于基础模型(蓝色),但在变换后的提示下急剧退化(压力测试);PIRL(绿色)在压力测试下保持准确率。