教师词元何时可靠?用于推理的位置加权 同策略 自 蒸馏
When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning
摘要
同策略 self-蒸馏 (OPSD) 使用特权教师在其自己的部署上训练学生,但其标准目标对所有生成的词元进行同等权重,隐式地将特权教师目标视为在每个学生访问的前缀上同样可靠。现有的基于熵的 OPD 方法通过用教师熵调节 词元级 监督来放松这种均匀性,但推理中的高教师熵具有模糊的可靠性含义:它可以反映不可行的不确定性或良性解决方案多样性。为了识别这种现象,我们引入了分支生存力诊断。具体来说,我们记录特权答案教师提示中的下一个标记替代项,在学生提示加上其 同策略 前缀之后强制执行每个替代项,并测试生成的学生模板延续是否恢复正确答案。在 Qwen3-4B 上,我们发现定向序列内位置分数是教师词元可靠性的最强测试预测因子,达到了 0.83 的 ROC 曲线下面积 (AUROC);局部不确定性分数最多为 0.57。受这种轨迹级结构的启发,我们提出了位置加权 同策略 Self-蒸馏 (PW-OPSD),它应用不断增加的位置权重,同时保持与 OPSD 相同的学生采样轨迹、特权教师前向计算和剪辑的前向 KL 目标。在我们对不同随机种子的综合评估中,诊断衍生的 PW-OPSD 将 AIME 2024 和 AIME 2025 Avg@12 提高了 +1.0 和 +1.1 点,并且对来自不同系列的两个更大规模模型 DeepSeek-R1-Distill-Llama-8B 和 Olmo-3-7B-Think 的泛化评估也显示出一致的聚合 Avg@12 改进。这些结果表明,蒸馏 推理中的教师词元可靠性是轨迹结构的,无需额外的教师计算即可使用。