论文

GUPO:后训练 大语言模型 的梯度不确定性感知策略优化

GUPO: Gradient Uncertainty-aware Policy Optimization for Post-Training Large Language Models

模型训练强化学习

摘要

组相对策略优化 (GRPO) 已成为 后训练 大语言模型 (LLM) 广泛使用的推理方法。在GRPO中,同一小批量内不同查询引起的组梯度直接平均以形成策略更新。然而,这些组梯度可能指向相互冲突的方向。我们的实证分析表明,群体梯度冲突往往与效率较低的政策更新相关,因此在此类冲突下需要可靠的聚合更新方向。标准 GRPO 聚合将实现的组梯度视为确定性贡献,并且不考虑聚合期间其可靠性的差异。为了解决这个问题,我们提出了梯度不确定性感知策略优化(GUPO),它将每个组梯度建模为贝叶斯公式下的随机变量,并估计其概率分布。然后,GUPO 使用基于狄利克雷的公式导出梯度不确定性,并用它来校准聚合过程中每个组梯度的贡献。对多个基准的大量实验证明了 GUPO 的有效性。