论文

分词器税:量化和解释印度语言子词分词的跨语言成本

The Tokenizer Tax: Quantifying and Explaining the Cross-Lingual Cost of Subword Tokenization for Indian Languages

模型评测模型行为与机制分析

摘要

大语言模型 (LLM) 通过子字分词器处理文本,而不是直接读取字符或单词。由于这些分词器主要是在以英语为中心的语料库上进行训练的,因此它们给许多非英语语言带来了系统性且经常被忽视的缺点。在这项工作中,我们使用 FLORES-200 并行语料库量化了印度语言的分词器税,测量了六种广泛使用的分词器和 14 种语言的分词器生育率。在 cl100k_base(GPT-3.5 和 GPT-4 使用)下,印度语言相对于英语平均经历 8.0 倍的标记化税,马拉雅拉姆语达到 13.0 倍,将有效上下文窗口减少到英语用户可用于同等语义内容的有效上下文窗口的 12%。我们确定了这种差异背后的主要机制:失败的字节对合并使文本碎片化为单字节标记,合并失败与标记器税密切相关(Pearson r = 0.89)。我们进一步表明,这种现象不是印度文字的固有属性,而是标记器设计的结果。 XLM-R 和 OpenAI 的 o200k_base 等多语言分词器将印度语分词器税平均降低了 73%,这表明这种差异在很大程度上是可以弥补的。除了象征性统计数据之外,我们还通过表明在固定上下文预算下,印度语言文档保留的原始内容比同等英语文档少得多来量化实际结果。最后,我们在 Belebele 基准上检查了分词器的生育能力和阅读理解表现之间的关系,发现这种明显的相关性很大程度上是由语言资源可用性来解释的,而不仅仅是分词器的行为。