论文
预训练 LLM 的就地分词器扩展
In-Place Tokenizer Expansion for Pre-trained LLMs
摘要
固定在 预训练 开头的分词器按 预训练 语料库的比例分配词汇,反映当时的部署优先级。当这些优先级发生变化时,后来添加的语言会被分成每个单词更多的标记,这可能会增加这些语言用户的延迟、计算和能源消耗。云模型可以提供广泛的词汇量,因为嵌入和 LM-head 矩阵只是其参数的一小部分。在紧凑模型上,这些矩阵占每个词元解码带宽的重要份额,因此设备上模型提供较小的词汇表并接受固定语言集之外的碎片。我们提出了分词器扩展,这是一种在模型生产者控制其设计时升级预训练模型的分词器的就地方法。我们继续在多语言语料库上合并现有分词器的 BPE,因此大多数源标记作为单个标记保留不变,并且每个新标记都精确分解为源标记。我们原封不动地复制遗留的嵌入行,并将新行初始化为其源子标记嵌入的平均值。两阶段适应、仅嵌入训练然后继续全模型 预训练,恢复源检查点质量。我们将该配方应用于 LFM2-8B-A1B(8B 参数混合专家模型)的持续预训练检查点,以帮助生成具有 128K 分词器的 LFM2.5-8B-A1B。扩展的分词器对印地语和越南语的编码比源代码大约少了 $2.4\times$ 和 $2.6\times$(泰语最多 $4.0\times$)。将这些减少与测量的较大词汇量的每个词元成本相结合,我们估计这些语言在我们的参考设备上的每个字符解码速度将提高 2.2$-$3.7\times$。我们发布了模型权重和扩展的标记器,并报告了塑造配方的负面发现。