论文
用自生成数据做中间训练改进语言模型的强化学习
Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models
摘要
大语言模型 (LLM) 中强化学习 (RL) 的有效性取决于 RL 之前和期间使用的数据的性质和多样性。特别是,推理问题通常可以通过依赖于不同形式推理的多种方式来解决,并且仅接触训练数据中有限范围的此类方法可能会限制强化学习的有效性。受此启发,我们研究了在训练中期使用各种自行生成的数据作为 RL 训练之前的中间步骤。具体来说,我们采用了以 George Polya 的问题解决方法为指导的引导数据生成框架,为训练数据中的每个问题生成正确答案的多个变体,然后进行微调。我们首先提供关于此类数据的中期训练如何改进强化学习的理论视角,并解释策略梯度更新如何激励组合多种方法。然后,我们凭经验证明,使用训练中期数据初始化的强化学习模型在各种数学推理基准和其他 OOD 任务(如代码生成和叙述推理)中实现了一致的改进。总的来说,我们的调查研究表明,通过自我生成的数据学习多种解决问题的方法的语言模型有助于后续的强化学习。
