论文
大语言模型词元化的计数训练与最小成本编码
Counting and Min-Cost Encoding for Tokenization in Large Language Models
摘要
主流大语言模型依赖词元化器将文本编码为词元序列。对于相同文本,不同词元化器生成的序列长度可能显著不同。在模型架构固定时,更短的词元序列对应更低的推理时间。我们提出名为Counting and Filtering(CNF,计数与筛选)的词元化器训练方法,以及名为Min-Cost Encoding(MCE,最小成本编码)的文本编码算法。MCE在文本片段上定义成本函数,通过全局最小化总分段成本确定最佳分段。CNF直接统计有效子串构建原始词表,再根据MCE对训练语料分段时的实际词元使用情况进行筛选,形成最终词表。与BPE相比,CNF-MCE组合具有更高词元效率、更强可扩展性和更低依赖性。在六类文本和两组词表规模上,CNF-MCE的压缩效果始终优于被评估的BPE词元化器。使用250K词表时,相比o200k_base和qwen250k,CNF-MCE在英语网页文本上分别提高26%和30%的压缩率。将词表扩展至1M条目的英语网页实验显示,相对BPE的改善仍持续,词元效率提高超过60%,词表利用率从52.9%提高至96.9%。MCE不依赖BPE的合并列表,也不依赖UnigramLM的词元概率,因此适用于BPE、UnigramLM、CNF等多种来源的词表。在1.8B和8B规模从头训练的语言模型,在11个基准上的平均表现与使用BPE词元化器的模型相当。结果表明,CNF-MCE能显著提高词元效率,同时保持有竞争力的下游表现。