元音符号不是字母:多语言分词器生育力的预分词上限
Vowel Signs Are Not Letters: A Pre-tokenization Ceiling on Multilingual Tokenizer Fertility
摘要
使用 HuggingFace ByteLevel 预分词器的字节级 BPE 分词器继承了 GPT-2 的单词正则表达式,其中单词定义为 \p{L}+(一个或多个 Unicode 字母)。在附标文字中,元音被写成组合标记;因此,这种模式在每个元音符号处分割每个单词。由于 BPE 仅在预词元内合并,因此无论词汇量大小或语料库组成如何,这些分裂都会在训练中持续存在。我们将这种效应形式化为生育率的 无需训练 下限。在平行语料库的 26 种语言中,17 种附标中的每一种都受到影响,范围从 1.47 倍(藏语)到 9.02 倍(泰语),而拉丁语、西里尔语、朝鲜语和汉语则恰好为 1.00 倍。对于 5 种语言,仅在该字符类中不同的匹配标记器对落在预测下限的 2.2% 范围内,尼泊尔语每个单词得分为 4.78,而每个词得分为 1.58。当训练语料库中的尼泊尔语份额从 5% 增加到 95% 时,损坏的分词器几乎没有变化(1.7%),而固定分词器则变化了 33.9%,这将结构上限与数据短缺区分开来,而无需检查任何代码。我们训练了三个 268M 模型,它们的区别仅在于它们的分词器;固定变体在相同的计算下每字节的保留尼泊尔位数降低了 4.43%,并且当给定相同的字节且计算量为 1.59 倍时,它仍然领先。对 3,479 个 HuggingFace 存储库的普查发现,63.3% 下载次数最多的文本生成模型中仅包含字母词类,占下载量的 72.5%。 GPT-4o 的 o200k 模式已经使用了标记感知字类,使得修复本身成为现有技术。我们量化它的价值,展示如何仅从症状来识别它的缺失,映射它到达的脚本,测量它的部署范围,并发布一个包含 65,536 个条目的尼泊尔语-英语标记器,该标记器可以从笔记本电脑上的公共数据重新生成这里的每个数字。