论文
大语言模型学生是否继承了 OOD 稳健性?用于可靠知识转移的不变性加权蒸馏
Do Student LLMs Inherit OOD Robustness? Invariance-Weighted Distillation for Reliable Knowledge Transfer
摘要
知识蒸馏(KD)旨在将高绩效的大语言模型教师压缩为轻量级的学生。然而,优秀的学生在分布外(OOD)环境中经常表现出严重的表现下降,这是一个尚未得到充分探索的关键差距。我们确定了导致 OOD 性能下降的两种复合机制:(1)数据虚假性:学生可以在蒸馏数据集中学习虚假相关性而不是真正的因果关系; (2)教师能力:标准KD统一对待所有样本,忽略教师是受到因果特征的指导还是受到给定样本上虚假捷径的误导。为了应对这些挑战,我们提出了不变性加权蒸馏(IWD),这是一种基于理论的框架,它使用从多个合成环境中的预测不变性得出的教师因果依赖性的估计来动态地重新加权训练样本。 IWD 扰乱虚假线索,同时保留核心语义,为教师预测保持不变的样本分配更高的蒸馏权重,这表明更依赖因果特征而不是虚假特征。我们从理论上证明,与标准均匀加权 KD 相比,IWD 降低了学生的杂散与因果 (S2C) 梯度比,从而推动学生获得更不变的表示。对两个模型系列(DeBERTa-v3 和 Qwen-2.5)的四个 NLP 基准(MNLI、SQuAD-v2、CoNLL-2003 NER 和 SST-2)进行的实验表明,IWD 在 OOD 评估上始终优于强大的 KD 基线,同时保持有竞争力的分布内 (ID) 性能。具体而言,IWD 在 16 个 OOD 基准测试中的 15 个中实现了最高准确度,并且在 NLI 上比标准 KD 平均 OOD 性能提高了 4.34 个百分点,在 QA 上提高了 14.94 个百分点。