论文

X-Token:投影引导交叉分词器 知识蒸馏

X-Token: Projection-Guided Cross-Tokenizer Knowledge Distillation

摘要

交叉分词器 知识蒸馏 允许学生模型向具有不兼容词汇的教师学习。先前的工作在隐藏状态或 logits 上运行;后者是优选的直接替代品,不需要辅助组件。基于 logits 的方法要么仅使用正确标记概率,缺少教师分布中的完整“暗知识”,要么对完整输出分布进行操作,依赖于严格的标记划分和/或无原则的启发式排名。我们确定了全分布、基于 logits 的方法的两个关键缺点:(i)不常见的词元失败,其中关键词元落入不匹配的子集(例如,Llama 在数字分割 Qwen 监督下的 1100 个多位数字)并在训练期间被抑制,与较弱的相同词元器 KD 相比,将 GSM8k 从 12.89 降低到 2.56老师; (ii) 过度保守的匹配,其中严格的一对一匹配排除了表面形式上接近等效的标记。这些故障需要不同的补救措施:当关键词元未对齐时消除分区,并在对齐可靠时改进分区。我们提出了 X-Token,这是一种针对这些问题的两种互补损失公式的方法。 P-KL 删除了分区,并通过稀疏投影矩阵 W(从标记器级字符串规则初始化)将学生的分布与教师的分布对齐,以解决不常见的标记故障。 H-KL 保留了混合形式,同时放松了匹配,使每个学生词元与其 W 下排名靠前的教师映射保持一致。两个目标共享 W 并自然扩展到多个教师。根据经验,在 Llama-3.2-1B 上,X-Token 在 Qwen3-4B 老师的情况下比当前最先进的 GOLD 平均分高出 +3.82 分,在 Phi-4-Mini 老师的情况下比当前最先进的 GOLD 平均分高出 +0.5 分。此外,两名教师设置(Phi-4-mini + Llama-3B)比单教师 蒸馏 提高了 +1.3 个百分点。