论文
计算最佳标记化
Compute Optimal Tokenization
摘要
缩放法则可以实现数据量和语言模型大小的最佳选择,但数据单元(词元)对这种关系的影响仍未得到充分研究。在这项工作中,我们系统地研究了由压缩率(即每个词元的平均文本字节数)控制的词元的信息粒度如何影响扩展趋势。我们训练了 988 个潜在标记化模型 (BLT),参数范围从 50M 到 7B,可以设置所需的压缩率。这种灵活性使我们能够研究压缩率的作用,压缩率远远超过使用流行的 BPE 标记生成器获得的每个标记 4.57 字节。我们的实验表明,在计算最优配置中,模型参数计数与以字节为单位测量的数据大小成正比,而不是通常认为的以词元为单位(Kaplan 等人,2020 年;Hoffmann 等人,2022 年)。此外,我们发现最佳压缩率与 BPE 获得的压缩率不同,并且随着计算而降低。这些发现可推广到潜在和子词标记化,以及英语以外的语言,指导语言模型开发人员选择标记化方案,以实现最大的计算效率。