论文

用自生成数据做中间训练改进语言模型的强化学习

Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models

模型训练合成数据

摘要

大语言模型 (LLM) 中强化学习 (RL) 的有效性取决于 RL 之前和期间使用的数据的性质和多样性。特别是,推理问题通常可以通过依赖于不同形式推理的多种方式来解决,并且仅接触训练数据中有限范围的此类方法可能会限制强化学习的有效性。受此启发,我们研究了在训练中期使用各种自行生成的数据作为 RL 训练之前的中间步骤。具体来说,我们采用了以 George Polya 的问题解决方法为指导的引导数据生成框架,为训练数据中的每个问题生成正确答案的多个变体,然后进行微调。我们首先提供关于此类数据的中期训练如何改进强化学习的理论视角,并解释策略梯度更新如何激励组合多种方法。然后,我们凭经验证明,使用训练中期数据初始化的强化学习模型在各种数学推理基准和其他 OOD 任务(如代码生成和叙述推理)中实现了一致的改进。总的来说,我们的调查研究表明,通过自我生成的数据学习多种解决问题的方法的语言模型有助于后续的强化学习。

用自生成数据做中间训练改进语言模型的强化学习:论文配图
图 1:启发式指导的中期训练概述。上图:我们借鉴了 Pólya 的问题解决启发法,每个启发法都由文本描述和少数样本来定义,展示了应用于示例问题的启发法。右下:对于每个问题-启发式对,我们根据启发式提示从基本模型中采样 128 个候选响应,通过基于规则的验证过滤正确性,并根据奖励模型 ℛphi\mathcal{R}_{\phi} 选择得分最高的响应。左下:生成的数据集𝒟Pólya\mathcal{D}_{\text{P\'{o}lya}},每个问题包含 nn 个解决方案变体,用于在强化学习之前对基本指令模型进行中间训练。