论文
叛逆的学生:用自我蒸馏的 RLVR 反转老师的信号进行推理探索
Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR
摘要
Self-蒸馏 已经成为 后训练 LLM 的强大框架,其中以额外信息为条件的教师指导没有额外信息的学生,两者都来自同一模型。虽然这种指导在学生失败时很有用,但在成功采样轨迹时,相同的机制反而会覆盖学生的选择并抑制其自己的推理。因此,我们建议反向阅读原始的自我 蒸馏 信号:当学生沿着老师无法预测的路径取得成功时,这些标记反映了其自我驱动的推理。在此基础上,我们提出了 RLRT(RLVR with Reversed Teacher),它通过在正确的部署上强化这些词元来增强 GRPO。我们将其解释为 RLVR 的一种新探索形式:不是统一的多样性,而是基于学生自身成功的有价值的探索。在基础、指令调整和思维调整的 Qwen3 检查点上,RLRT 大大优于自我 蒸馏 和基于探索的基线,将信息不对称建立为 RLVR 的新的、有原则的设计轴。