选择优势熵自适应地平线 GRPO:语言模型高效强化学习的非对称 词元级 折扣
Selective-Advantage Entropy-Adaptive Horizon GRPO: Asymmetric Token-Level Discounting for Efficient Reinforcement Learning of Language Models
摘要
组相对策略优化(GRPO)已成为一种有效的强化学习算法,用于在推理任务上对齐语言模型,但它对称地对待每个词元位置和每个采样的执行轨迹。我们引入了两个互补的扩展:(i) 自适应地平线 GRPO (AH-GRPO),它使用基于累积熵的折扣对每个词元的策略梯度进行加权,当模型不确定时,该折扣会减少有效地平线;(ii) 选择性优势 AH-GRPO (SA-AH-GRPO),它仅将这种折扣应用于负优势的执行轨迹,而使正优势、成功的轨迹保持不变。我们使用 Qwen 2.5-1.5B-Instruct 和经过 LoRA 微调的 Qwen 2.5-3B-Instruct 在 GSM8K 数学推理基准上评估 alpha = 0 的标准 GRPO、alpha = 0.5 的 AH-GRPO 和 alpha = 0.5 的 SA-AH-GRPO。在 3B 模型上,SA-AH-GRPO 在第 30 步处达到峰值 Pass@1 = 0.858,并在 180 步处保持 0.846,训练方差降低至 0.0246,相对于 GRPO 降低了 3.6 倍,同时匹配其峰值精度。在 1.5B 模型上,SA-AH-GRPO 的峰值 Pass@1 达到 0.686,比零样本基线 0.637 有所提高。我们的分析表明,不对称折扣保留了正确解决方案上的完整梯度信号,防止熵崩溃,并大大稳定了训练,这表明强化学习的原则性归纳偏差在结构化生成任务上具有可验证的奖励。