论文

DVLM:用双词表语言模型支持跨分词器蒸馏

Dual-Vocabulary Language Model for Cross-Tokenizer Distillation

摘要

on-policy蒸馏 (OPD) 架起了教师监督和学生行为的桥梁,但不同的师生分词器在输入分词化 (#1) 和输出logits (#2) 中引入了错位。现有的方法通过匹配相同文本范围或将词元转换为字节来解决前者,通常会丢失细粒度的词元信息或破坏本机词元范式,而对于后者,诸如排名、填充或键词元选择之类的策略仅保留共享的 logit 维度,从而导致大量分布损失。在本文中,我们提出了双词汇语言模型(DVLM),它用新的学生词汇投影头取代了教师的 LM 头,并获得完整学生logits(对于#2)。为了支持学生词元(对于#1),它采用并行词元化序列(PTS)作为输入,该序列连接原始教师词元化序列和通过将每个学生词元独立转换为教师词元组而形成的重新词元化序列。为了避免与原始教师标记的推理不一致,混合前缀注意力(HPA)进一步将重新标记化的组限制为其相应的教师前缀,并使用其最后状态作为原始学生标记表示的聚合,以投影到学生词汇空间中。同样,通过结合使用 PTS 和 HPA,DVLM 教师可以在 OPD 期间对学生的输入标记化和输出 logit 提供分布对齐的监督。实验结果表明,我们的 DVLM 教师具有与原始教师模型类似的收敛损失,并使学生模型能够提高六个推理任务的性能。