论文
利用离线强化学习对代码生成LLM进行高效后训练
Efficient Post-training of LLMs for Code Generation With Offline Reinforcement Learning
摘要
使用在线强化学习(RL)的后训练是LLM(包括代码生成模型)的重要训练步骤。然而,面向代码生成的在线RL涉及LLM推理与对生成输出的验证,可能耗费大量时间与资源。本文通过利用现有代码数据集,探索离线RL在代码生成模型中的应用。我们的实验证明,离线RL是提升LLM性能的有效训练策略。我们表明,离线RL对小型LLM与具挑战性的编程问题尤为有益。