论文
为什么自我蒸馏(有时)会降低LLM的推理能力?
Why Does Self-Distillation (Sometimes) Degrade the Reasoning Capability of LLMs?
摘要
Self-蒸馏 已成为 LLM 的有效 后训练 范例,通常可以提高性能,同时缩短推理轨迹。然而,在数学推理中,我们发现它可以减少响应长度,同时降低性能。我们将这种退化追溯到认知语言表达的抑制——模型在推理过程中表达不确定性。通过改变调节上下文丰富度和任务覆盖范围的对照实验,我们表明,让教师调节丰富的信息会抑制不确定性表达,从而在有限的任务覆盖范围内实现快速域内优化,但会损害 OOD 性能,其中看不见的问题受益于表达不确定性和相应调整。在 Qwen3-1.7B/8B、DeepSeek-Distill-Qwen-7B 和 Olmo3-7B-Instruct 中,我们观察到性能下降高达 40%。我们的研究结果强调,暴露适当水平的不确定性对于稳健推理至关重要,并强调优化推理行为而不仅仅是强化正确答案轨迹的重要性。