论文

SIPO:将强化学习与在策略自蒸馏相结合

SIPO: Unifying Reinforcement Learning with On-Policy Self-Distillation

模型训练强化学习RLVR

摘要

具有可验证奖励的强化学习(RLVR)已成为改进各种任务的大语言模型(LLM)的标准范例,但其稀疏的结果奖励缺乏中间步骤的词元级信用分配。为了解决这个问题,策略自我蒸馏(OPSD)利用具有特权背景的自学教师来提供额外的密集学习信号。然而,由于自学者往往过于自信,并对长推理轨迹施加过大的惩罚,OPSD 在实践中经常陷入困境。为了缓解这个问题,我们提出自指导策略优化(SIPO)与对比自教师来提供密集的信用。在每次迭代中,SIPO 都会根据当前政策的提示对多次展示进行采样,并通过环境奖励对其进行评分,并通过将参考答案与小组内犯的错误进行配对,为每次展示构建两个教师环境。然后,该模型在两种情况下重新评估自己的反应,使用两个教师对数概率之间的差异作为标记级反馈,以便两种情况下共享的偏差有望在很大程度上消除。由此产生的目标为每次rollout带来词元级别的优势:奖励仍然设定每次更新的主要方向,而自学者则在词元之间重新分配信用。即使在每次rollout都失败且集团相对优势消失的集团中,国家知识产权局仍然提供了学习信号。通过保留任务奖励的直接优化,同时提供密集的词元级反馈,这种方法将强化学习和策略自我蒸馏联系起来。跨多个推理和代码生成基准的广泛实验表明,在没有外部教师或额外生成的情况下,SIPO 的性能优于 RLVR 和 OPSD 基准。