论文

每种语言都有其分词器:用于高效多语言大语言模型的模块化分词器

To Each Language Its Tokenizer: Modular Tokenizers for Efficient Multilingual LLMs

模型训练预训练

摘要

多语言大型语言模型 (LLM) 传统上依赖于所有受支持语言共享的单一词汇表,这可能会导致它们之间的压缩不均匀。此外,它们的大型嵌入和输出矩阵会增加内存使用量并降低推理速度,尤其是对于小规模模型而言。这也是一种浪费,因为模型通常仅用于一部分语言。为了解决这些问题,我们引入了用于多语言模型训练的模块化框架。首先,我们提出了学习大型模块化 BPE 和 Unigram 分词器的方法,这些方法能够提取适合任何语言子集的子分词器。这些子分词器实现了与单语言分词器相当的压缩,并提高了跨语言公平性。其次,我们设计了一种预训练策略,对子分词器进行采样以形成批次,将预测限制为相关词汇子集,并在词汇量很大的情况下允许高效训练。这支持使用特定于语言的词汇表的任意组合进行有效推理。因此,它可以减少内存使用并加快模型的推理速度,而不会牺牲性能。