论文
根据人类反馈进行强化学习的元学习奖励塑造
Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback
摘要
人类反馈强化学习 (RLHF) 是使 大语言模型 与人类偏好保持一致的标准方法,但其质量受到静态、与任务无关的奖励模型的限制。这种不匹配会导致学习信号稀疏和对齐不理想。我们引入了 MeRLa(元学习奖励塑造),这是一个原则框架,它在 RLHF 训练之前跨辅助任务元学习任务感知塑造函数 $Φ(x,y;φ)$。学习的塑造产生复合奖励,在提供特定于任务的学习信号的同时保持策略最优性。我们的元目标结合了任务区分、熵正则化和基于势的守恒,以实现稳定收敛。我们为策略不变性提供理论保证,分析表示漂移敏感性,并正式解决熵最大化带来的激励失调问题。 LLaMA-3-8B 在四个基准测试上的实验表明,相对于 PPO、DPO、GRPO 和 DAPO 均有持续改进,在 AlpacaEval 2.0 上实现了 90.8% 的长度控制胜率,在 MT-Bench 上获得了 9.14 的分数,训练不稳定性降低了 41%。当与基于流程和基于标准的增强奖励相结合时,MeRLa 保留了其优势。