论文
无批评强化学习中的取消假设:从结果奖励到词元积分
The Cancellation Hypothesis in Critic-Free RL: From Outcome Rewards to Token Credits
摘要
基于序列级奖励的 LLM 的无批评强化学习的一种普遍接受的解释是,它以积极的优势强化成功的部署,同时惩罚失败的部署。相比之下,我们从 词元级 的角度研究无批评的 RL,揭示了词元翻转现象:正向和负向的采样轨迹表现出非常相似的词元比例,这些词元的概率在 RL 训练期间被提高或抑制。为了解释这一现象,我们进一步表明,词元概率的变化并不完全由其自身优势决定;与其他词元的耦合梯度相互作用也发挥着不可忽视的作用。具体来说,这些词元耦合效应主要发生在均以低置信度预测的相同词元之间。基于此分析,我们提出取消假设:由于耦合,相反的信号抵消了正向和负向采样轨迹所共享的词元,而更具体于成功采样轨迹的词元得到更强的强化,从而从采样轨迹级别奖励中诱导隐藏的 词元级 贡献分配。我们用补充的经验证据支持这一假设。 (1) 与仅进行积极采样轨迹的训练相比,无批评强化学习将更新从模板和格式化标记转向推理标记; (2) 由无批评者 RL 推动的词元始终表现出比抑制词元更高的价值,无论它们是源自积极还是消极的采样轨迹。在这个观点的指导下,我们实施了两种批处理干预措施,以鼓励或保留无批评的 RL 训练中的取消:保留查询的小批处理和奖励平衡批处理。尽管这些干预措施很简单,但它们改善了跨多个模型尺度的 RLVR 训练,支持取消作为无批评 RL 训练的解释原则和实用设计标准。