论文

DIVA-GRPO:通过难度自适应变体优势增强多模态推理

DIVA-GRPO: Enhancing Multimodal Reasoning through Difficulty-Adaptive Variant Advantage

模型训练强化学习RLVR

摘要

基于群组相对策略优化(GRPO)的强化学习(RL)已成为增强多模态大语言模型(MLLM)推理能力的广泛采用方法。虽然GRPO无需评论者即可实现长链推理,但它在困难问题上常受稀疏奖励之苦,且当组级奖励对过易或过难问题过于一致时出现优势消失。现有解决方案(样本扩展、选择性利用和间接奖励设计)往往无法在组内奖励分布中保持足够方差以产生清晰的优化信号。为此,我们提出DIVA-GRPO,一个从全局视角调整变体难度分布的难度自适应变体优势方法。DIVA-GRPO动态评估问题难度,采样具有适当难度级别的变体,并使用难度加权与归一化缩放在局部和全局组间计算优势。这缓解了奖励稀疏与优势消失,同时提升训练稳定性。在六个推理基准上的大量实验表明,DIVA-GRPO在训练效率与推理性能上均优于现有方法。代码: https://github.com/Siaaaaaa1/DIVA-GRPO

DIVA-GRPO:通过难度自适应变体优势增强多模态推理
图2:所提出的 DIVA-GRPO 方法概览。对于给定问题,我们基于过去的 rollout 奖励动态评估其难度,并自适应地采样不同难度级别的变体。如图所示,当原始问题较难时,会采样更容易的变体以确保奖励多样性。随后,我们计算局部(问题本身)与全局(问题及其变体)优势,并通过难度感知的重新加权与奖励范围重缩放得到最终优势,用以更新策略模型。