论文

更难更好:通过难度感知GRPO与多方面问题改写提升数学推理

Harder Is Better: Boosting Mathematical Reasoning via Difficulty-Aware GRPO and Multi-Aspect Question Reformulation

模型训练强化学习RLVR

摘要

可验证奖励强化学习(RLVR)为增强大模型数学推理提供了稳健机制。然而,我们从算法和数据两个视角发现,现有方法系统性地缺乏对更具挑战性问题的重视,尽管这些问题对精炼尚未成熟的能力非常重要。算法上,广泛使用的组相对策略优化(GRPO)存在隐式不平衡:越难的问题策略更新幅度越低。数据上,增强方法主要通过改写问题提升多样性,而未系统性提高内在难度。为解决这些问题,我们提出双向的MathForge框架,从两个视角入手提升数学推理,包含难度感知组策略优化(DGPO)算法和多方面问题改写(MQR)策略。具体而言,DGPO首先通过难度均衡的组优势估计纠正GRPO的隐式不平衡,再通过难度感知的问题级加权优先处理更难的问题。同时,MQR在保持原始金标准答案的同时从多个方面改写问题以提高难度。总体上,MathForge形成协同循环:MQR扩展数据边界,DGPO有效学习增广数据。大量实验表明,MathForge在各种数学推理任务上显著优于现有方法。代码和增广数据见 https://github.com/AMAP-ML/MathForge。