论文

当错误可以带来好处时:政策梯度不完美奖励的分类

When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient

模型训练奖励建模与过程监督

摘要

通过强化学习训练语言模型通常依赖于不完美的代理奖励,因为精确定义预期行为的 真值 奖励很少可用。用于评估代理奖励质量的标准指标(例如排名准确性)将不正确的奖励视为严格有害的。然而,在这项工作中,我们强调并非所有与 真值 的偏差都是相同的。通过理论上分析策略梯度优化期间哪些输出吸引概率,我们根据奖励错误对 真值 奖励增加的影响对奖励错误进行分类。分析表明,奖励错误虽然传统上被认为是有害的,但也可能是良性的,甚至是有益的,因为它可以防止政策因平庸的 真值 奖励而在产出上停滞不前。然后我们提出我们的理论的两个实际意义。首先,对于来自人类反馈的强化学习(RLHF),我们开发了奖励模型评估指标来解释奖励错误的危害性。与标准排名准确性相比,这些指标通常与 RLHF 后语言模型的性能相关性更好,但在稳健评估奖励模型方面仍然存在差距。其次,我们为具有可验证奖励的环境中的奖励设计提供见解。我们结果的一个关键主题是代理奖励函数的有效性在很大程度上取决于它与初始策略和学习算法的交互。