论文
掩码自蒸馏:将思维链内化到语言模型中
Masked Self-Distillation: Internalizing the Chain-of-Thought in Language Models
摘要
大型推理模型在推理时会在生成最终答案之前产生冗长、显式的中间步骤链。这些中间轨迹主导了延迟、内存占用和服务成本,尽管最终答案的正确性与轨迹的正确性并无因果关系,且轨迹长度也不是问题复杂度的可靠指标。这引出一个显而易见的问题:这些中间token所表达的计算能否被内化到语言模型的参数中,使其能够以更短的中间轨迹产生答案?我们提出掩码自蒸馏(masked self-distillation),一个基于知识蒸馏的后训练框架,其中同一模型的副本分别被实例化为教师和学生,学生模型被训练以内化全部或部分中间轨迹,从而在推理时更加高效。我们改变学生被训练去内化的中间轨迹比例,在完全内化与完全不内化之间插值。我们在两个推理领域开展受控实验:数学与图着色。我们使用掩码自蒸馏框架对Qwen3-4B与8B模型进行后训练。我们的结果表明,该方法可在多种领域和模型规模上提升任务性能的同时提高推理效率。我们系统分析了后训练模型中的效率提升能否泛化到OOD(分布外)问题。我们发现掩码自蒸馏模型在域内OOD问题上泛化良好,且该训练不会使学生模型在域外问题上产生灾难性遗忘。此外,我们的消融实验表明,监督微调能训练模型产生更短的轨迹,但以牺牲泛化为代价,这凸显了掩码自蒸馏中在线(on-policy)训练的重要性。
