论文
通过字节级模拟解耦语言 模型训练 的子字标记化的好处
Decoupling the Benefits of Subword Tokenization for Language Model Training via Byte-level Simulation
摘要
子词标记化是现代 大语言模型 (LLM) 的重要组成部分,但其对训练效率和模型性能的具体贡献仍然知之甚少。在这项工作中,我们通过将子字标记化的影响隔离在受控的字节级预训练管道中来解耦它们。我们制定并测试各个维度的假设,包括样本吞吐量、词汇量缩放和子词边界的语言先验。通过在字节级设置中模拟这些效果,我们加深了对为什么子字模型优于原始字节模型的理解,并提供了改进未来字节级和子字模型预训练的见解。具体来说,我们的实验强调了增加训练吞吐量以及将子词边界整合为显式先验或归纳偏差的关键作用。