隐形语言税:2026 年 LLM 词元化器中法语和地方语言的词元溢价以及法语优化原型
The Invisible Language Tax: Token Premiums of French and Regional Languages in 2026 LLM Tokenizers, and a French-Optimized Prototype
摘要
LLM 服务按词元计费,上下文窗口以词元衡量,但相同内容所需的词元数量因语言而异。我们在 NTREX-128(124 个非英语参考翻译)和《世界人权宣言》的区域语言上,通过广泛使用的 2026 模型(OpenAI o200k、Llama 3、Qwen3、DeepSeek V3/V4、Gemma 3、Mistral Tekken 和 Claude Generation-5 tokenizer,通过 Anthropic 的计数 API)的 7 个分词器来衡量词元溢价。法语所需词元比英语多31%至58%,简体中文则从少5%到多40%不等,并且在 7 个词元化器中的 6 个上比法语便宜。法国地区和海外语言的费用大约是英语的 1.6 至 3.3 倍。我们讨论历史记录重新发送、分层定价和固定上下文窗口如何放大 Agentic 使用的绝对差距。在对照实验(BPE、Europarl、50k 词汇量)中,将法语添加到分词器训练数据中会迅速降低溢价,而减少溢价的收益逐渐递减,同时英语词元成本上升。最后,我们展示了 Baracoda FR v1.2,一个具有Tekken词汇量的字节级 BPE 原型。在对设计过程中从未咨询过的六个语料库进行的最终测试中,使用预先声明固定的协议,它在法语上使用的词元比Tekken少 11.5%,在英语上少使用 3.7%;在删除与训练数据重叠的测试语句并且具有相同的普通词元预算后,结果仍然成立。它在其他语言上表现更差,并且在相当的词汇量下,它的表现并不优于 CroissantLLM。这些只是分割结果;对模型质量和任务成本的影响仍有待证明。