论文
Wasserstein 基于人类反馈的强化学习的分布式鲁棒遗憾优化
Wasserstein Distributionally Robust Regret Optimization for Reinforcement Learning from Human Feedback
摘要
来自人类反馈的强化学习 (RLHF) 是用于调整 大语言模型 的核心 后训练 工具,但其训练奖励只是真正人类效用的学习代理。这会在客观错误指定的情况下产生决策问题:策略根据估计的奖励进行优化,而部署性能则由未观察到的人口偏好决定。由此产生的差距导致奖励过度优化,在真实质量恶化后代理奖励不断提高。我们提出了 RLHF 的分布式鲁棒后悔优化(DRRO),并在奖励法则上设置了 Wasserstein 模糊度,使用奖励向量之间的即时 $\ell_p$ 距离作为传输成本。与悲观最坏情况价值的标准分布稳健优化不同,DRRO 相对于相同合理奖励扰动下的最佳策略,悲观最坏情况的遗憾。我们表明,表达政策问题分解为及时后悔问题。对于每个提示,内部对手都有一个双范数封闭形式;在我们的算法使用的 $\ell_1$ 传输成本下,优化器具有注水结构。这些结果催生了一种实用的策略梯度算法,该算法为 GRPO 式训练添加了简单的采样奖励。理论和实验都表明,DRRO 不像标准 DRO 那样过度悲观,并且比现有基线更有效地缓解过度优化。