论文
跨 25 种欧洲语言的分词额外开销:领域不变性、跨语言少样本效应和乌克兰语的额外开销
The Tokenizer Tax Across 25 European Languages: Domain Invariance, Cross-Lingual Few-Shot Effects, and the Ukrainian Penalty
摘要
分词器的词元膨胀率(每个单词的分词数量)给非英语 NLP 带来了隐性成本。我们在并行文本上测量了 25 种欧洲语言的 10 个基础模型的词元膨胀率,从而生成了该大陆第一个受控分词额外开销图谱。额外开销跨度为 2.5 倍,从英语(1.2 个词元/单词)到希腊语/马耳他语(~3.1),遵循清晰的层次结构:罗曼语(1.5-1.7)、日耳曼语(1.7-1.9)、斯拉夫语(2.2-2.5)、乌拉尔语/波罗的海语(2.7-3.0)。乌克兰语 (2.7) 的费用比同源斯拉夫语言高 15-18%,反映出 预训练 数据中代表性不足。词元膨胀率排名在三个文本寄存器中是域不变的(rho > 0.97)。子词分析表明,高生育力分词器会破坏形态边界,而不是保留它们。对四种斯拉夫语言的跨语言少样本评估表明,少样本效应是模型固有的,而不是依赖于语言的。我们将所有测量结果作为公共数据集发布。