论文

可消除与不可消除的成本:多语言分词额外开销的词元账本

Removable and Irreducible: A Token-Cost Ledger for the Multilingual Tokenization Tax

模型评测评测方法与指标

摘要

大语言模型 对非英语文本支付了有据可查的税收:相同的内容花费数倍的词元,并且由于注意力在序列长度上是二次方,因此需要更多的计算。我们询问有多少税收可以免除。将词元层构建为源编码 - Transformer 计算在序列长度上是单调的,其每原子底层是香农率 $H/\log_2 V$,该对象已在之前的工作中应用于词元生成器 - 我们组装了一个词元成本分类账,将每种语言的成本以固定的并行内容分割为可移动的编码冗余、剩余编码松弛、内在内容项和正交的、不可约的控制多模式而不是文本成本的字素到音素术语。在跨 8 种语言的 FLORES-200 上,生产标记器对于印度语脚本的标记比英语高出 8.9 美元\倍;在 $1,012$ 句子上训练的脚本匹配代码消除了该多余部分的中位数 $64\%$(引导 95\% CI $[0.638, 0.647]$),并且脚本公平信息层显示内在内容差异不到 $6\%$ - 税收是代表性的,而不是信息性的。构建的代码消除了受控源的 98\%$ 冗余,而词元税意味着高达 79\times$ 的注意力成本。我们对范围和失败很明确:这是计算和内存核算,而不是模型质量声明;我们既不衡量也不主张拼写术语的跨语言方向;我们的匹配代码是保守的小数据演示。我们贡献了统一的账本、可移除与内在的归因以及开放的单命令工具。