论文
从后验集中重新思考基于概率的强化学习
Rethinking Probability-Based Reinforcement Learning From Posterior Concentration
摘要
具有基于概率的奖励的无验证者强化学习提供了一种有前途的方法,可以在外部验证者不可用的情况下训练大语言模型进行一般推理任务。然而,这些奖励的可靠性,尤其是在长期推理中,仍未得到充分探索。这项工作确定了概率奖励的长度相关失败模式,我们将其称为后验集中现象(PCP)。我们表明,随着推理轨迹变长,以推理轨迹为条件的参考答案的概率通常会崩溃到低方差区间。这种现象导致几乎无法区分的奖励,在基于 GRPO 的设置下,这使得基于概率的策略优化不稳定且低效。受此启发,我们提出了具有浓度感知后验奖励的强化学习(RLCPR),这是一种无需验证者的 RL 框架,可明确考虑 PCP,以实现更好的优化稳定性和词元效率。它有两个组成部分:不确定性感知数据采样,可减少生成前易于集中的rollout;以及集中感知正则化,当后验奖励崩溃时,它会惩罚不必要的长痕迹。大量实验表明,除了更高的词元效率之外,RLCPR 在七个基准测试中的六个(包括通用领域和数学推理挑战)上比最先进的无验证器 RL 基线高出高达 4.0%。