BrahmicTokenizer-131K:o200k_base 的具有印度语功能的直接替代品
BrahmicTokenizer-131K: An Indic-Capable Drop-In Replacement for o200k_base
摘要
我们推出了 BrahmicTokenizer-131K,这是一个 131,072 词汇量的字节级 BPE 分词器,它弥补了 131K 词汇量类别的 Brahmic 压缩差距,同时保留了英语、欧盟语言和 OpenAI o200k_base 的代码压缩。我们通过两阶段改造构建它:(1) 脚本修剪作物,通过删除 9 个超出范围的书写系统,将 200,019 个标记减少到 131,072 个;(2) 对 2,372 个语料库死词汇槽进行外科手术改造,这些词汇槽是通过跨 9 个婆罗米语 Unicode 块的线性编程分配确定的。预分词器、解码器和继承的合并规则与 o200k_base 相比没有变化,这使得 BrahmicTokenizer-131K 成为分词器接口的直接替代品。在 2700 万份公共印度语预训练文本文档(28.4 亿单词,46.21 GB)上,在相同的词汇预算下,BrahmicTokenizer-131K 生成的标记比 Mistral-Nemo Tekken / Sarvam-m 少 26.7%,每种语言节省了 15.79%(泰米尔语)到 76.79%(Odia,4.31 倍压缩比)。 Odia 的优势可以通过包含零 Oriya 区块词元的《铁拳》/Sarvam-m 来机械地解释;我们的手术添加了 725 个。在非印度语内容上,BrahmicTokenizer-131K 与 o200k_base 的英语生育力相匹配(1.235 vs 1.232 个标记/单词),并在 HumanEval、MBPP 和 GSM8K 上击败 Tekken/Sarvam-m 4.0-14.2%。在我们的 14 个分词器基准测试中,它是唯一一款在 131K 预算下同时在婆罗米语、英语、欧盟、代码和数学方面具有竞争力的分词器。其他词汇类别(Sarvam-30B、Sarvam-1、MUTANT-Indic)的专业分词器以牺牲非印度语性能为代价实现了更好的印度语压缩:Sarvam-1 的英语能力比我们的差 15.9%,其代码/数学压缩比我们的差 26-33%。我们在 Apache 2.0 下发布了该工件:https://huggingface.co/theschoolofai/BrahmicTokenizer-131K。