论文

GRPO的策略梯度基础:贡献分配、梯度稀疏性与秩塌缩

On the Policy Gradient Foundations of Group Relative Policy Optimization: Credit Assignment, Gradient Sparsity, and Rank Collapse

模型训练强化学习

摘要

组相对策略优化 (GRPO) 通过使用分组采样轨迹的平均奖励作为基线,消除了 PPO 中的学习得到的价值模型。我们根据策略梯度定理的第一原理对 GRPO 进行了严格的推导,揭示了基本的贡献分配失败:在仅输出奖励下,采样轨迹中的每个词元都获得相同的优势,将 词元级贡献压缩为单个标量。我们证明这会导致梯度稀疏性在训练过程中加剧,并通过 Nemotron-4B/GSM8K 上 GRPO 梯度的 SVD 分析凭经验证明,无论组大小 $R \in \{2, 4, 8\}$,梯度矩阵的有效秩 $\approx$ 2。我们将其形式化为一种内在的 2 级结构,该结构源于对优势的零和约束,并推导出 GRPO 基线最佳的条件。我们的结果描述了 GRPO 的简单性在理论上是合理的,并将学分分配瓶颈确定为多步推理的关键限制。