论文

目标与搜索:分解什么是好的标记器

Objective vs. Search: Decomposing What Makes a Good Tokeniser

模型训练预训练

摘要

现代语言模型使用两种主要的标记化算法:字节对编码 (BPE) 和 UnigramLM。它们在两个正交轴上有所不同:它们的优化目标(压缩与对数似然)和搜索过程(自下而上合并与自上而下修剪)。现有的比较混淆了这些轴,使得我们不清楚观察到的差异是否源于正在优化的内容与优化方式。我们通过引入两种完成此 2x2 设计空间的新标记化算法来解开这两者:BottomUpLL(一种自下而上的基于似然性的标记化器)和 TopDownComp(一种自上而下的基于压缩的标记化器)。我们使用每种算法生成的标记器来训练语言模型,这些标记器各不相同:模型大小、词汇量大小和领域(仅限英语与多语言)。通过评估每字节位数的模型,我们发现搜索过程(而不是目标)是主导因素:自下而上的分词器在大多数设置中始终实现较低的每字节位数。然而,评估 BLiMP 任务的模型表明设计选择和性能之间没有一致的关系。总的来说,我们的结果阐明了分词器设计选择对语言建模性能的影响,为其更有原则的构建提供了具体指导。