论文

GRAIL:具有可验证奖励的强化学习的梯度重新加权优势

GRAIL: Gradient-Reweighted Advantages for Reinforcement Learning with Verifiable Rewards

模型训练强化学习

摘要

具有可验证奖励的强化学习(例如 GRPO)现在是 大语言模型 (LLM) 中改进数学推理的常用方法。然而,当前的方法通常向所有词元广播一个序列级优势,或者使用成本高昂的过程奖励模型(PRM)进行步骤级监督。统一优势分配假设所有词元对最终奖励的贡献相同。这会稀释梯度信号,因为有缺陷的推理步骤和填充词会与有效的逻辑推理一样强烈地更新。为了解决这个问题,我们引入了梯度重新加权优势(GRAIL),这是一种内在的词元优势重新加权方法。 GRAIL 使用梯度激活显着性来对对最终答案局部更敏感的标记赋予更多权重。对 Qwen3、R1-distilled 和 OctoThinker 系列的五个模型的评估表明,GRAIL 的性能始终优于 GRPO。 GRAIL 的准确率平均提高了 3.60%,Pass@3 平均提高了 3.05%,这表明无需流程级监督即可实现细粒度推理对齐。