论文
因材施教:针对 LLM 推理的方向自适应自我 蒸馏
Tailoring Teaching to Aptitude: Direction-Adaptive Self-Distillation for LLM Reasoning
摘要
同策略 self-蒸馏 (OPSD) 是一种新兴的 LLM 后训练 范式,其中模型充当自己的老师:以参考跟踪或提示等特权信息为条件,相同的策略对其自身的采样轨迹提供密集的 词元级 监督。然而,最近的研究表明,OPSD 通过抑制预测不确定性来降低复杂推理能力,从而支持探索和假设修正。我们的 词元级 分析表明,这种失败是由于在具有不同不确定性水平的词元上应用统一的教师监督方向而引起的:遵循特权自学教师会抑制高熵下的探索,而偏离教师会降低低熵下的步骤准确性。因此,我们提出 \textbf{Direction-Adaptive Self-蒸馏} (\textbf{DASD}),它将特权 self-蒸馏 从统一的教师模仿重新构建为熵路由的定向监督:高熵词元被推离特权教师以保留探索,而低熵词元被拉向教师以稳定步骤级执行。在六个数学推理基准测试中,DASD 在强大的 RLVR 和自我 蒸馏 基线上实现了最佳宏 Avg@16。 Pass@$k$、推理健康和泛化分析表明,这些平均收益来自于在不牺牲步骤级执行的情况下保留探索。