论文
反思思维模型的同策略自蒸馏
Rethinking On-Policy Self-Distillation for Thinking Models
摘要
自蒸馏是语言模型自我改进的有前景配方:模型在获得特权信息(如数学题解答)时可充当自己的教师。这对思维模型似乎尤其有吸引力——它们可用测试时推理吸收特权信息。出人意料地,我们显示特权自蒸馏在长推理轨迹上损害思维模型:跨五个Qwen3与OLMo思维模型(AIME24/25、HMMT25评估),特权上下文蒸馏造成最高17%的avg@16相对下降。退化随扣留的特权上下文量扩展,且在长rollout预算下最显著——而思维模型恰在此获得最大增益。该失败模式不限于自蒸馏:同策略蒸馏(OPD)改善思维模型,而特权OPD反转这些增益。诊断把失败与特权教师上下文在高熵分叉位点的学习重塑联系起来——多个续写仍合理、可能导向不同推理路径之处。特权上下文降低思维模型rollout的分叉率(指令模型则否),形成有趣的二分:特权上下文可帮助指令模型却伤害更强的思维模型。效应在学生开始自纠分支时可见:特权OPD惩罚普通OPD所支持的重新考虑token。经特权教师训练的思维模型产生更少的验证、回溯与对冲标记——即便长度归一后亦然。结果表明强思维模型的自蒸馏需要注意token级信号,尤其围绕纠正与推理步骤。