论文
衡量词元化溢价:对服务不足的语言社区的成本审计
Measuring the Tokenization Premium: A Cost Audit for Underserved Language Communities
摘要
大语言模型 越来越多地被部署为通用教育和技术援助系统,但其底层基础设施并没有平等对待语言。一个未经充分审查的差异来源是标记化:语义上等效的内容可能需要不同语言的标记计数显着不同,从而影响 API 成本、延迟和调用模型之前的可用上下文长度。我们引入了词元化公平审计(TEA),这是一个用于衡量技术辅导内容中词元化溢价的可重复基准。 TEA 在从英语翻译成孟加拉语、印地语、阿拉伯语、泰米尔语和约鲁巴语的 120 项 Python 调试语料库上评估了三种广泛使用的分词器:GPT-4o 的 o200k 基础、Qwen2.5-7B 和 Mistral-7B。孟加拉语和印地语是主要的验证案例,而其余语言则提供探索性的跨文字和跨语系比较。在这个语料库中,孟加拉语需要与英语一样多的 GPT-4o 标记(1.56 倍),将相同语义内容的名义 128k 标记上下文窗口减少到有效的 82k 标记英语等效容量。使用 Qwen2.5 和 Mistral 分词器,孟加拉语需要最多英语分词计数(4.5 倍)。约鲁巴语尽管使用拉丁文字,但仍表现出最高的 GPT-4o 标记化溢价(2.37 倍),这表明标记化不平等不能仅用文字族来解释。这些结果表明,词元化可以造成可衡量的经济和功能障碍,突显了需要将词元化视为服务不足的语言社区的与股权相关的基础设施层,特别是在教育系统依赖于低成本或离线功能的人工智能工具的情况下。