论文
带回价值模型:LLM 强化学习中价值建模的生成批评
Bringing Value Models Back: Generative Critics for Value Modeling in LLM Reinforcement Learning
摘要
奖励归因是强化学习 (RL) 的核心挑战。经典的Actor–Critic方法通过基于学习价值函数的细粒度优势估计来解决这一挑战。然而,在现代 大语言模型 (LLM) RL 中通常会避免学习价值模型,因为传统的判别式价值评估器很难可靠地训练。我们重新审视价值建模,并认为这种困难部分是由于表达能力有限造成的。特别是,表示复杂性理论表明,在现有价值模型使用的一次性预测范式下,价值函数可能很难近似,而我们的缩放实验表明,此类价值评估器并不能随着规模的扩大而可靠地改进。受这一观察的启发,我们提出了生成式Actor–Critic(GenAC),它将一次性标量值预测替换为生成式价值评估器,该生成式价值评估器在生成价值估计之前执行思想链推理。我们进一步引入了上下文调节,这有助于价值评估器在整个训练过程中保持与当前策略模型的校准。 GenAC 改进了价值近似、排名可靠性和分布外泛化,这些收益转化为比基于价值和无价值基线更强的下游 RL 性能。总的来说,我们的结果表明,更强的价值建模是改善 LLM 强化学习中的奖励归因的一个有前途的方向。