论文

揭秘语言模型的强化学习 后训练

Demystifying Reinforcement Learning Post-Training of Language Models

模型评测模型行为与机制分析

摘要

强化学习 (RL) 后训练 已成为增强 大语言模型 (LLM) 功能的强大框架,可实现令人印象深刻的推理、数学和编码能力。然而对于许多研究人员和实践者来说,经典强化学习背后的原理仍然是一个“黑匣子”。在这项工作中,我们解构了 RL 后训练 算法,研究每个步骤以阐明表面之下实际发生的情况。通过在受控和简化的环境中将强化学习的机制与可验证奖励隔离开来,我们研究了基础模型的先验分布、奖励信号的粒度、提示分布的多样性和模型规模如何塑造强化学习的结果。我们使用策略输出分布的熵作为镜头来比较通过预训练、SFT 和 RL 后训练 学习到的分布,揭示每个阶段如何塑造模型确定性。我们的调查揭示了这些选择如何相互作用以影响 后训练 的成功。例如,我们表明所谓的“虚假奖励”的效果取决于 后训练 所使用的提示分布。我们还深入探讨了为什么 RL 后训练 的成功取决于基础模型是否已经在所需行为上放置了足够的概率质量,并将其与 RL 中探索的经典概念联系起来。最终,我们将这本入门书作为资源提供给 NLP 社区中那些希望将 RL 作为工具纳入其工具箱的人们。