论文

JOLT:让在线自蒸馏教师提供适合学生的指导

A Good Self-Teacher Meets the Student Where They Are: Joint On-Policy Learning and Teaching

模型优化模型训练强化学习奖励建模与过程监督蒸馏

摘要

结果奖励的强化学习 (RL) 受到监督稀疏的影响,特别是在困难的长期任务上,在这些任务中,成功的轨迹很少见且生成成本高昂。按策略蒸馏(OPD)提供了一种有吸引力的替代方案,它通过学生同代中更强大的老师提供密集的Token级监督。自蒸馏方法通过将相同的策略限制在特权信息上以充当自己的教师,从而进一步消除了对单独教师模型的需求。然而,单独的特权调节并不能保证最终的蒸馏更新能够提高学生的水平。事实上,特权信息可能导致教师通过学生无法使用的捷径来解决任务,从而产生与学生当前行为不匹配的监督。因此,即使是表现较好的教师也可能提供降低学生表现的指导。为了解决这个问题,我们分析了特权教师的选择如何影响学生的更新。我们推导出教师局部性的充要条件 蒸馏更新为学生奖励梯度的正倍数。我们的分析表明,教师不仅应该出色地完成任务,还应该提供适合学生当前能力的指导。这种特征激发了一种实用的教师培训替代方案,它将结果奖励与针对学生的Token级 Kullback-Leibler (KL) 正则化相结合。基于这一结果,我们提出了联合在策略学习和教学(JOLT),它以两个角色联合训练单一策略:使用 KL 正则化目标的特权教师和使用密集在策略蒸馏的非特权学生。在数学推理、编码、工具使用和终端使用方面,JOLT 提高了训练效率和表现,并从学生奖励中获得进一步收益。

JOLT:让在线自蒸馏教师提供适合学生的指导:论文原图
图 8:GSM8K 上的超参数敏感性,涵盖 JOLT 配置(左)和跨方法的学习率(右)。