论文
具有跨情节记忆和策略的自我审查强化学习(SRRL) 蒸馏
Self-Review Reinforcement Learning (SRRL) with Cross-Episode Memory and Policy Distillation
摘要
强化学习通常用于使用环境反馈来训练 大语言模型。在应用设置中,环境通常提供稀疏或延迟的反馈。这使得模型很难确定其推理中的哪些行为导致了成功或失败。因此,从这些信号中有效地学习是很困难的,因为模型必须确定每次失败应如何在后续迭代中通知有意义的行为纠正。我们引入了一个训练框架,即自我审查强化学习,它将明确的自我审查步骤嵌入到每个 RL 片段中。当第一次响应失败时,模型会进行自我审查,以识别出了什么问题,这为改进第二次尝试提供了条件。与 Reflexion 等推理时间反射方法不同,该框架通过策略梯度优化自我审查,并通过选择性 蒸馏 将改进内部化到基本策略中,确保它们在未来的事件中持续存在。跨情节记忆可以保留成功的自我回顾,以便在训练期间遇到类似任务时重复使用。我们在 GSM8K 基准上使用 GRPO 优化器跨两种语言模型(Qwen 3-4B 和 OLMo-3-7B)根据标准 RLVR 基线评估 SRRL。 SRRL 在最终奖励表现上始终优于 RLVR,并通过成功地将反馈转化为行为改进来实现更高的学习效率。