论文
Tokka-Bench:覆盖100种自然语言和20种编程语言的分词器评测
Tokka-Bench: Evaluating Tokenizers Across 100 Natural and 20 Programming Languages
摘要
大型语言模型依赖于子词标记器,其质量因语言而异,但不存在用于广泛比较评估的标准化多度量框架。我们推出了 Tokka-Bench,这是一个开源框架,它使用适合每种书写系统的语言感知分段,针对 100 种自然语言(30 多种脚本)和 20 种编程语言的五个补充指标(每个标记的字节数、唯一标记覆盖率、子词生育率、分词率和词汇构成)评估标记器。比较各个语言中的七个 BPE 分词器(GPT-2、GPT-4、gpt-oss、Llama 3.1、Gemma 3、Qwen3 和 Kimi K2),我们发现词汇分配策略比原始词汇量更重要,并且尽管自然语言配置文件不同,但编程语言效率在最近的分词器中已经趋同。框架、数据和交互式仪表板都是公开可用的。
