论文
DIVA-GRPO:通过难度自适应变体优势增强多模态推理
DIVA-GRPO: Enhancing Multimodal Reasoning through Difficulty-Adaptive Variant Advantage
摘要
基于群组相对策略优化(GRPO)的强化学习(RL)已成为增强多模态大语言模型(MLLM)推理能力的广泛采用方法。虽然GRPO无需评论者即可实现长链推理,但它在困难问题上常受稀疏奖励之苦,且当组级奖励对过易或过难问题过于一致时出现优势消失。现有解决方案(样本扩展、选择性利用和间接奖励设计)往往无法在组内奖励分布中保持足够方差以产生清晰的优化信号。为此,我们提出DIVA-GRPO,一个从全局视角调整变体难度分布的难度自适应变体优势方法。DIVA-GRPO动态评估问题难度,采样具有适当难度级别的变体,并使用难度加权与归一化缩放在局部和全局组间计算优势。这缓解了奖励稀疏与优势消失,同时提升训练稳定性。在六个推理基准上的大量实验表明,DIVA-GRPO在训练效率与推理性能上均优于现有方法。代码: https://github.com/Siaaaaaa1/DIVA-GRPO
