论文
多语言模型中分词器选择的特定于语言的影响
Language-Specific Effects of Tokenizer Choice in Multilingual Language Models
摘要
分词器的选择会影响多语言语言建模,但词汇量是有限的,而且词汇量通常受到限制:改进某些语言的表示通常是以牺牲其他语言为代价的。因此,我们要问分词器的选择在不同语言中是否同样重要,这是当前文献没有回答的问题。为此,我们训练了 123 个语言模型,涵盖 54 个分词器。在主要比较中,架构、训练语料库、训练token预算和优化保持固定,因此模型仅在token生成器上有所不同。我们发现,对于语言模型训练数据较少的语言,分词器的选择更为重要:在 54 个分词器中,随着模型训练数据份额的减少,语言每字节位数 (BPB) 的标准差会增加(在 31 种经过训练的语言中,Spearman rho = -0.52,在使用字边界编写的 28 种语言中,Spearman rho = -0.69)。将一种语言排除在分词器训练之外会提高我们研究的每种语言的 BPB,并且对于语言模型训练数据较少的语言,惩罚往往更大。给予 然而,对于资源较低的语言来说,较大份额的分词器训练数据并不能无条件地帮助这些语言:同等权重和相对于语言模型训练数据的份额反转分配都会增加它们的 BPB,特别是当语言模型训练重复数据时。最后,哪些内在分词器属性与更好的 BPB 相关,在不同的语言中是不同的,这提供了进一步的证据,证明什么是好的分词器取决于语言。我们发现量化这些属性的指标可以成功地用于预测下游模型的成对 BPB 排名,这提出了在训练语言模型之前筛选分词器候选者的实用策略。