论文
RISE:通过自外推策略蒸馏进行递归改进
RISE: Recursive Improvement via Self-Extrapolating Policy Distillation
摘要
在策略蒸馏(OPD)为语言模型训练后提供密集的、按Token的监督,但其有效性受到教师质量的瓶颈:外部教师遭受分布不匹配的影响,而具有特权条件的自蒸馏则受到上下文学习能力的限制。我们提出 RISE (通过 Self-Extrapolating Policy Distillation 进行 Recursive Improvement),它直接从模型自己的 RLVR 训练轨迹构建合成教师。通过推断当前检查点和尾随锚点之间的位移(在参数空间或输出 Logit 空间中),RISE 将稀疏结果引起的参数更新转换为密集的Token级目标,无需任何外部模型或特权条件。 RISE 将 RLVR 和 OPD 结合在一个互补的循环中:结果奖励将外推推向正确的推理,而外推的教师则完善Token级别的决策。此外,由于随着学生的进步,教师每次迭代都会得到更新,因此蒸馏成为一种递归改进机制,而不是一次性压缩步骤。涵盖数学推理、多领域 STEM、代码生成和多轮智能体任务的实验表明,RISE 在所有设置中都优于仅 RLVR 训练和策略自蒸馏。
