论文

使用分割树进行标记化

Tokenization with Split Trees

AI 基础设施数据基础设施

摘要

我们引入了分割树标记化(ToaST),这是一种在新的递归推理过程下直接优化压缩的子词标记化方法。 ToaST 使用预先计算的字节 n 元语法计数将每个预词元贪婪地拆分为完整的二叉树,与任何词汇无关。给定一个词汇表,推理会递归地下降每个分裂树,并发出每条路径上到达的第一个词汇表内节点。词汇选择被制定为一个整数程序(IP),它可以最小化此推理过程下所有分裂树上的总标记计数。线性规划 (LP) 松弛在实践中几乎是积分的,可产生可证明接近最优的词汇表,训练时间根据经验按分裂树的数量呈二次方缩放。在英语文本中,在词汇量为 40,960 及以上的情况下,ToaST 与 BPE、WordPiece 和 UnigramLM 相比,减少了 11% 以上的标记数量,减少了使用此标记器的模型的推理标记数量,从而延长了有效上下文长度。 ToaST 使用常见单字节词元的频率也低于这些基准,从而显着提高了 Renyi 效率。在训练 1.5B 参数语言模型的实验中,ToaST 获得了最高的 CORE 分数,比基线高出 2.6%--7.6%,对三项任务中的两项具有显着性,并且在 22 项单独任务中的 13 项上得分最高。