论文

更少的单词,而不是更少的标记:衡量每个命题的梵文标记化惩罚

Fewer Words, Not Fewer Tokens: Measuring the Sanskrit Tokenization Penalty per Proposition

模型评测模型行为与机制分析

摘要

梵文将格、数字、人称和时态融合成词尾,并将从句链接成复合词,因此每个词的信息密集。该密度是否能够在子词标记化中幸存下来是一个单独的问题,要根据含义单位而不是每个单词来询问。在相同的 FLORES-200 开发测试内容中,梵文的成本是部署词汇量为 200,019 id 或更多的分词器下英语词元的 1.774-2.187 倍,但仅为印地语词元的 1.325-1.353 倍。与部署的英语分词器相比,梵文训练的 BPE 手臂在每个命题上看起来比当代散文中的英语便宜 (0.887)。与匹配的英语对照相比,在同一语料库的英语侧训练相同的算法和词汇,这种翻转消失了:在 32,000 和 64,000 条中,所有 8 个匹配对,每个大小匹配的手臂与配对匹配和字节匹配控制相比,在散文上位于 1.0 以上,95% 的间隔排除它。随着词汇量的增长,差距逐渐缩小:在 128,000 条时,BPE 对在域中的读取值为 0.983,同时在域外 (1.025) 和 FLORES (1.116) 上保持高于奇偶校验。该比率分解为字符长度比率和每个字符的标记比率,第二个始终接近 1:在匹配标记化中幸存下来的是字符级长度,梵文散文在 SLP1 中比英语缺乏(1.028),而梵文诗歌则有(0.596)。强有力的声明是关于部署实践的:在当代散文和 FLORES 上,SLP1 中的梵文方面与部署的 o200k 英语枢轴相对应,在人们实际发布的标记器下,每个命题梵文花费 1.831-2.899 个英语标记。代码、结果快照和这里的每个表都是公开的。