论文
从近期后续检查点学习:RLVR的时间自蒸馏
Learning from the Near Future: Temporal Self-Distillation for RLVR
摘要
可验证奖励强化学习是推理模型后训练的重要方法,但有效轨迹难以发现或探索收窄时,纯同策略学习效率有限。现有自指导方法主要复用当前或较早模型已有的能力。我们研究能否利用后续训练才出现的能力,即从模型自身后来的版本学习。时间自蒸馏由更强的后续检查点指导当前策略。我们假设最有用的时间教师未必最强:它既要提供新能力,也要与学习者足够兼容,因此关注近期后续检查点。我们通过两种机制研究这一原则:NPO以经过核验的后续版本轨迹进行离策略行为迁移,NPD在学习者生成的轨迹上进行同策略词元级迁移。AutoNPO自适应判断指导何时有用以及应回退多远,将后续版本指导转为重复自举过程。八个图文基准上,NPO将GRPO得分从60.25提高至62.84,AutoNPO达到63.15,在纯文本与视频推理中也有一致改善。NPD中,近期教师在继续强化学习后达到63.23,而较远教师为61.92,尽管前者蒸馏后即时表现更低。这说明有效时间自蒸馏取决于新能力与兼容性的平衡,而不只是教师强度。