论文

贪婪最长匹配标记化的联合优化

Joint Optimization for Greedy Longest-match Tokenization

模型训练预训练

摘要

最近的工作表明,可以训练子词词汇表来优化特定推理规则的压缩,而不是依赖于贪婪的启发式方法,例如字节对编码(BPE)。我们将这种方法扩展到贪婪的从左到右最长匹配解码,这是 WordPiece 底层的快速且广泛使用的推理规则。我们引入了贪婪最长匹配标记化的联合优化(JOLT),它将词汇学习制定为词汇选择和分段选择变量的整数程序。贪婪一致性约束确保每个优化的分段与所选词汇下最长匹配解码生成的分段完全匹配,从而使训练目标与部署时间标记化保持一致。为了扩展优化,我们解决了线性规划松弛问题,并仅针对未解决的预标记选择性地引入高阶分段。由此产生的松弛几乎是积分的:四舍五入的解决方案落在训练范围的 LP 下限的 0.008 - 0.176% 范围内。该界限还表明,在贪婪最长匹配解码下,BPE 已经处于最佳可实现压缩的 1 - 2% 范围内,而 JOLT 则缩小了剩余差距的 89.6 - 99.4%。在跨四个训练范围和 32,000 和 64,000 词汇量的保留验证数据上,JOLT 产生的词元比 BPE 少 0.78%,并且随着训练范围的扩大,改进通常会增加。这些结果表明,推理对齐词汇优化可以恢复 BPE 留下的大部分有限压缩空间,同时提供接近最优的证明。