突破词元模型的性能上限:蒸馏更小、更强的字节模型
Breaking the Token Ceiling: Distilling Smaller, Stronger Byte Models
摘要
小模型通过从共享其标记化方案的较大模型中提炼而变得更加强大。然而,随着计算和数据的增加,蒸馏字节和词元模型在扩展趋势方面的表现是否相似?为了进行这种比较,我们引入了两种变体来有效地将词元logits转换为字节logits:1)近似:Marginalize-It,2)精确:End-Of-Token。然后,我们提出了第一个对同时改变两个维度的仅解码器密集Transformer模型进行过度训练的大规模研究:标记化方案(标记、字节、带 eot 的字节)和训练目标(蒸馏与交叉熵),扫描具有大约 10 亿个参数直至 1 万亿字节数据的层参数匹配模型。在跨越三个类别的八个基准测试中:多项选择 QA、语言生成和机器翻译,我们发现 Token-1B 模型在低 FLOP 状态下优于字节模型(End-Of-Token-1B 和 Bytes-1B),但最终达到稳定状态;字节模型开始时更差,但通过更多计算超过了 Token-1B 模型,达到了更高的下游任务性能上限。推断平均 top-1 误差与验证 BPB 缩放定律预测,渐进式 End-Of-Token-1B 的性能优于蒸馏式 Token-1B 高达 4%。它们的数据效率也更高,仅使用六分之一的训练数据即可达到与蒸馏后的 Token-1B 的性能相匹配。此外,通过对 256 字节的小词汇表(而不是 100K 词元量级)进行操作,它们避免了在 logit 转储期间进行 top-k 截断的需要,同时还将 logit 存储成本降低到大约五分之一。最后,我们的下游性能缩放定律预测,我们的蒸馏 End-Of-Token-1B 模型在平均下游任务上将渐近超过 Llama 3.2-1B、Gemma-3-1B-pt 和 Gemma 2B 模型,分别高达 6.5%、8.1% 和 2.1%。