知识蒸馏 对小语言模型偏差的不对称影响
The Asymmetric Effects of Knowledge Distillation on Bias in Small Language Models
摘要
我们表明,小型指令调整语言模型中的 知识蒸馏 (KD) 对偏差具有不对称影响,并且正确测量它们需要考虑拒绝质量移动的位置以及解析器可以合理评分的内容。在明确的任务 (BBQ-disambig) 上,来自 Mistral-7B 教师的基于响应的 蒸馏 确实改善了最有上下文偏差的基线 (SmolLM2-1.7B-Instruct) 的上下文跟踪:在承诺的(非弃权)答案中,用刻板印象覆盖正确上下文的比率从 44.5% 下降到 37.2%,准确度从0.55至0.61。在模棱两可的任务(BBQ-ambig)上,相同的 蒸馏 会降低条件拒绝:15% 的情况下,基线正确弃权,而不是收到刻板印象答案(沉默-丢失),而精炼的拒绝模式仅微弱地保留基线的(Spearman rho = 0.44)。这种伤害在第二个学生家庭 (OLMo-2-1B-Instruct) 上重现并加剧:沉默损失达到 49%,而完全沉默占新偏见的 95%。两个明显更强的结果是伪影。无条件覆盖指标报告在 Gemma-2-9B 老师的指导下提高了 44% -> 23%,一旦以承诺的答案为条件,则缩小到 44.5% -> 39.8%:模型放弃了 43% 的项目,其准确性从 0.55 下降到 0.35。一旦排除解析器无效的 logits-KD 配置并纠正解析器,明显的交叉条件独立性就会在有效的 19 配置网格上反转为正相关(rho=0.58,p<0.01)。综合指标(CrowS-Pairs、整体烧烤刻板印象信赖得分)对两种效果进行平均并隐藏每个项目的伤害。我们提出了按条件校准诊断(PCCD),这是一个评估拒绝模式保留、承诺答案上下文跟踪和能力保留的三步协议。我们网格中的配置没有通过全部三个步骤。