非洲语言税:量化前沿非洲语言标记化的成本、延迟和上下文惩罚 LLM
The African Language Tax: Quantifying the Cost, Latency, and Context Penalty of Tokenizing African Languages in Frontier LLMs
摘要
商业 大语言模型 账单、规模延迟和每个词元的预算背景。然而,分词器在某些语言中比在其他语言中为相同含义分配更多的子词标记,因此具有高标记丰富性的语言的使用者在调用模型之前会付出结构性的代价。一般来说,这种惩罚是针对多语言环境记录的,但尚未在企业部署经济学和认知环境能力层面对非洲语言进行系统测量。我们使用平行语料库对涵盖 5 个语系和 3 个文字的 20 种非洲语言(拉丁语、Ge'ez/埃塞俄比亚语、N'Ko;19 种出现在主要 FLORES-200+ 语料库中,尼日利亚洋泾浜语仅通过 MAFAND-MT 进行测量)进行测量,以便将语言效果与内容隔离。在 FLORES-200+ 上的 11 个前沿和开放标记器中,每种非洲语言的标记化溢价均高于英语(GPT-5 / o200k_base 的中位数为 1.88 倍,N'Ko 的中位数高达 8.92 倍);埃塞俄比亚语和 N'Ko 文字的惩罚最大(达到 7-9 倍),并且在整个语料库中几乎不变(FLORES 与 SIB-200 Pearson r = 0.9998)。转化为部署术语,这会导致高达 8.9 倍的推理成本和等效的生成延迟乘数(GPT-5 上的 N'Ko 与英语;阿姆哈拉语为 7.4 倍),以及英语有效上下文窗口的 11%。当前可用的非洲语言最好的分词器 Gemma 4 将平均溢价从 3.31 倍 (cl100k_base) 降低到 2.38 倍,但没有任何分词器可以消除惩罚。我们为非洲建设者发布了开放测量工具(afri-fertility)、公共排行榜、结果数据集和缓解指南。对于那些最无力承受惩罚的语言来说,惩罚最为严重,这是直接编码到子词词汇中的数字鸿沟。