论文
通过 LLM 的 后训练 中的 logits 平均,用 SFT 补充强化学习
Complementing reinforcement learning with SFT through logit averaging in the post training of LLMs
摘要
我们引入了一种新颖的方法,该方法对冻结参考策略(例如 SFT)和可训练策略的 logits 进行平均,并将该方法合并到组相对策略优化(GRPO)中。与可验证奖励的强化学习(RLVR)方法相比,我们的提案不涉及 Kullback Leibler(KL)正则化或批评家;可训练策略和参考锚点通过 logits 平均结构耦合,以利用可训练策略的推理专业知识,同时保持 SFT 的格式化优势。我们的方法在 MATH、cn-k12 和 MMLU 上进行了评估,结果显示相对于规范 KL 正则化 GRPO 具有更高的准确度或至少相当的准确度。