论文
LLM推理自蒸馏中的自适应教师曝光
Adaptive Teacher Exposure for Self-Distillation in LLM Reasoning
摘要
在线策略自蒸馏已成为LLM推理的一种有效配方:一个享有特权信息的教师对学生自身的rollout进行监督,同时以参考解答为条件。然而几乎所有这类方法都共有一个未经质疑的设计选择:教师总是看到完整的参考推理。我们认为这一默认设置本身就是问题的一部分,并识别出教师侧的曝光失配:当教师以远超学生当前能力的推理为条件时,所产生的token目标过强而难以吸收。受控的固定曝光扫描从两个方面具体印证了这一点:1)完全曝光并不可靠地是最优选择;2)随着教师看到更多特权推理,师生失配单调增长。这促使我们将教师曝光不是视为固定超参数,而是视为可学习的训练时控制变量。因此我们提出用于自蒸馏的自适应教师曝光(ATESD)。ATESD用一个轻量的Beta策略控制器、以紧凑的训练状态统计量为条件来建模揭示比例,并在一段较短的保留窗口内用一次采样的曝光进行学生更新。为使该曝光控制器可学习,我们用带折扣的学习进度奖励来优化它:该奖励依据每次保留决策对学生未来改进的作用而非即时损失变化来评分,从而解决在线策略蒸馏引起的延迟贡献归因问题。在Qwen3-{1.7B, 4B, 8B}上于AIME 24、AIME 25和HMMT 25的实验表明,ATESD持续优于有竞争力的自蒸馏与RL基线,相对OPSD分别提升+0.95、+2.05和+2.33 Average@12分,并确立了自适应教师曝光作为推理自蒸馏的有效新维度。
