论文
统一的 Pair-GRPO 系列:从隐式到显式的偏好约束以实现稳定和通用的 RL 对齐
A Unified Pair-GRPO Family: From Implicit to Explicit Preference Constraints for Stable and General RL Alignment
摘要
通过人类偏好强化学习(RLHF)进行的 大语言模型(LLM)对齐在主流成对偏好学习范式中存在策略更新不稳定、梯度方向模糊、可解释性差和梯度方差高等问题。为了系统地解决这些局限性,我们建立了一个以 Pair-GRPO 系列为中心的基于偏好的 RL 优化的统一理论框架,包括两个紧密耦合的变体:Soft-Pair-GRPO 和 Hard-Pair-GRPO。 Soft-Pair-GRPO 是对组相对策略优化 (GRPO) 的最小修改,它用二元成对偏好奖励取代了组归一化标量奖励,保留了 GRPO 的裁剪代理和 KL 正则化结构。我们证明了一个关键的梯度等价定理:在当前策略周围的一阶泰勒展开下,Soft-Pair-GRPO 的梯度是标准 GRPO 梯度的正标量倍数,这解释了尽管丢弃连续奖励幅度,但其经验稳定性。在此基础上,我们提出了 Hard-Pair-GRPO,这是一种先进的变体,引入了显式的局部概率约束和约束 KL 拟合优化,以进一步抑制梯度噪声和全局策略漂移。我们为这两种变体提供了全面的理论保证——包括单调策略改进、确定性梯度方向、梯度方差减少和动态步长收敛。对标准 LLM 对齐基准(HH-RLHF、UltraFeedback)和 MuJoCo 连续控制任务 HalfCheetah-v4 的大量实验表明,我们的 Pair-GRPO 系列在对齐质量、人类偏好获胜率、训练稳定性和一般强化学习的泛化方面始终优于最先进的基线。消融研究验证了每个核心组件的关键贡献。