论文
提炼出重要的东西:大语言模型的置信感知选择性提炼
Distilling What Matters: Confidence-Aware Selective Distillation for Large Language Models
摘要
知识蒸馏(KD)通过匹配输出分布来训练容量较小的学生模型来模仿容量较大的教师模型,隐含地假设教师是可靠的预言家。在大语言模型(LLM)中,这种假设常常失败:教师的预测可能表现出高熵和幻觉,导致标准 KD 降低经过良好校准的学生先验。我们提出了 CaRE-KD,一种置信门控蒸馏框架,用不确定性自适应优化取代静态目标。 CaRE-KD 有两个组成部分:词元级损失(CaRE-Divergence),根据教师与学生的置信度在正向和反向 KL 散度之间自适应切换;以及批量级认知拒绝机制(Revival),当教师比学生更加不确定时,它会抑制更新。我们提供了梯度级分析,显示了这种双粒度设计如何引入先前静态散度无法重现的条件校准机制。根据经验,在 8 个师生对和 11 个涵盖指令遵循、聊天对齐、代码生成和数学推理的基准中,CaRE-KD 在强大的基线(Skewed-KL、$α$--$β$ 分歧)上提供了一致的收益。亮点包括在遵循指令的任务上平均 ROUGE-L 高达 $+3.2$,在 MBPP 上 $+2.1$ pass@1,在 GSM8k 上 $+1.7$ 准确度,以及在最强基线上的 CollegeMath 上 $+1.8$ 准确度,并且在 LLM 作为评审的真实性方面持续获得收益(与 Skewed-RKL 相比每项任务高达 $+2.5$)。 Revival 进一步充当一个有原则的、与损失无关的插件,通过过滤认知上不可靠的教师监督来系统地加强现有的蒸馏目标。