论文

当标记化与语言建模联合优化时,会学到什么标记?

What Tokens are Learned when Tokenization is Optimized Jointly with Language Modeling?

模型评测模型行为与机制分析

摘要

标记化是语言建模管道的基本组成部分。尽管它很重要,但它通常是固定的,尽管它会显着影响跨语言的模型性能。在这项工作中,我们分析了当标记化与语言建模联合优化时学习了哪些标记。我们将 SSLM 和 H-Net 等无分词器方法与 18 种类型和脚本多样化语言的固定分词器进行比较。我们的结果表明,联合优化从根本上改变了词元结构。 SSLM 恢复形态对齐且上下文高效的词元,而 H-Net 优先考虑字节级效率,生成与标准子词词汇表重叠度非常低的较长词元。我们进一步表明,标记化行为因语言类型而异。粘着语言在学习时表现出更动态的分段模式。通过下游评估,使用预先训练然后微调的 BERT 模型,我们发现基于 SSLM 的预标记化始终降低了语言建模的复杂性,并在词汇量不同的情况下实现了具有竞争力的下游性能。总体而言,无分词器的方法优化了上下文和计算效率,而不是严格的形态结构,从而为下游 NLP 提供了根本不同但有效的词汇表。