论文

HPO:稀疏奖励制度下稳定高效训练的滞后策略优化

HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime

模型训练强化学习

摘要

我们在可验证奖励稀疏的情况下研究了 GRPO 式强化学习的一种狭窄但常见的失败模式:早期更新包含更多具有负面优势的响应,而不是具有正面优势的响应,而响应级别长度归一化将更新的幅度与输出的长度联系起来。我们提出了滞后策略优化(HPO),这是对 GRPO 的最小修改,它减少了负优势更新的权重,并用平均长度归一化取代了每个响应长度归一化。我们进一步引入了自适应HPO(A-HPO),它根据批次级优势符号统计来设置滞后权重,从而无需调整固定的滞后权重。在我们的 TeleLogs 和 Countdown 实验中,与 GRPO 相比,A-HPO 提高了每次更新的奖励,在早期稀疏奖励机制中收益最大。在 TeleLogs 上,A-HPO 的最终奖励为 0.84,比 SAPO 高 5%,比 GSPO 高 11%,比 GRPO 高 15%,同时保持相当的响应长度。在 Countdown 中,A-HPO 在 1.5B-7B 模型中的初始配置和最困难配置中实现了最大收益。对迟滞权重的消融研究表明,与纯正更新或完全对称更新相比,A-HPO 的增益来自于更好地平衡正负优势的贡献。