论文

每个字母超过两个字节:西里尔文人工智能系统中的标记化开销

Beyond Two Bytes per Letter: Tokenization Overhead in Cyrillic AI Systems

模型评测鲁棒性、公平性与可信度评测

摘要

现代多语言标记器通常比英语更严重地分裂乌克兰语和其他代表性不足的西里尔文字语言,从而造成成本和上下文容量的差异。我们通过九种生产标记器和五种具有标准化西里尔字母和拉丁语表示的语言来量化这一开销,涵盖 837 万种单词形式。在语料库基准上,乌克兰语在现代标记器上显示出 68-121% 的标记开销,在较旧的 cl100k 上显示出 220%(通过 BrUK 和 Brown 语料库的全文丰富性进行测量)。在具有独立验证的英语基线的子集中,开销与西里尔语词汇分配呈负相关,尽管这种关联在统计上并不显着(Spearman rho = -0.536,p = 0.215,n = 7)。我们评估两种缓解策略。在包含 1,536 个产品和 145 个查询的电子商务 RAG 基准上,LLMLingua-2 将乌克兰语输入长度减少了 47-49%,并且在 80 个可检索案例中没有出现压缩引起的价值损失。平衡字节级 BPE 标记器经过 200K 词汇量上限训练,收敛于 158,184 个实际条目,将保留的 UK/EN 比率从 2.22 倍降低到 1.30 倍。在大多数标记器上,罗马化将乌克兰语标记数量增加了 2-19%。在五种语言中,标记化效率有利于脚本在网络数据中更普遍。这些发现表明,训练数据分配会增加西里尔文标记化开销,并且在推理和标记化器设计阶段都可以缓解。