论文
离散化奖励模型
Discretizing Reward Models
摘要
尽管奖励模型被广泛使用,但人们对奖励模型在塑造强化学习中的作用知之甚少。奖励模型提供了一个诱人的承诺:它们在没有验证者或人类法官的情况下自动评估响应质量。与通常产生二进制分数的“可验证奖励”不同,奖励模型通常产生连续分数,使它们能够对响应中的细粒度差异敏感。然而,我们表明这种明显的优势是一个严重的弱点:许多流行的奖励模型过于敏感,为同样好的反应分配不同的分数。从理论上讲,我们证明看似完美的奖励模型可能是高度过度敏感的。从经验来看,这种过度敏感可能会导致糟糕的政策。我们建议使用“区分能力”和“特异性”(过度敏感的补充)的不同度量来评估奖励模型,而不是现有的“奖励模型准确性”概念。作为解决方案,我们描述了一种 无需训练 算法,该算法在任何神经奖励模型上使用蒙特卡罗 dropout 来生成离散奖励集群。从理论上讲,我们证明存在离散化,可以以最小的判别能力损失来减少过度敏感;根据经验,我们表明,在受控和自然 RL 设置中,与原始奖励训练相比,离散奖励会导致更少的 奖励作弊 和更好的策略。