论文
通过字节级接口的交叉标记器 LLM 蒸馏
Cross-Tokenizer LLM Distillation through a Byte-Level Interface
摘要
交叉分词器 蒸馏 (CTD),当教师和学生语言模型使用不同的分词器时,知识从教师到学生的转移,仍然是一个很大程度上未解决的问题。现有方法依赖启发式策略来对齐不匹配的词汇表,从而引入相当大的复杂性。在本文中,我们提出了一个简单但有效的基线,称为字节级 蒸馏 (BLD),它通过在跨标记器的通用接口(字节级)上运行来实现 CTD。更详细地说,我们将教师的输出分布转换为字节级概率,将轻量级字节级解码器头附加到学生,并通过这个共享字节级接口进行提取。尽管它很简单,但 BLD 在一系列具有 1B 到 8B 参数模型的 蒸馏 任务中,与更复杂的 CTD 方法相比,在多个基准测试中都表现得更出色,而且在一些基准测试中还超越了它们。我们的结果表明,字节级是跨分词器知识转移的自然共同点,同时也强调了所有任务和基准的一致改进仍然难以实现,这强调了 CTD 仍然是一个悬而未决的问题。