论文

潜在核心分词器:压缩,但有意义

Latent Core Tokenizer: Compress, but Meaningfully

模型训练预训练

摘要

分词器通常针对压缩进行优化,但紧凑的词汇表不一定能在不同语言之间均匀分配其容量。我们引入了 Latent Core Tokenizer (LCT),这是一种与语言无关的方法,它将结构发现与词汇构建分开。 LCT 使用最小描述长度、基于熵的边界信号和形态约束来在构建共享词汇表之前识别可重用的语言单元。在具有 20 万个token词汇量的 104 种语言中,LCT 比 BPE、Unigram 和奇偶感知 BPE 实现了更低的生育率和更高的 MorphScore,同时在token化成本方面保持了可比较的跨语言差异。在四个多语言下游基准中,LCT 的总得分分别比 BPE、Unigram 和奇偶感知 BPE 提高了 1.48、1.83 和 2.00 分。我们的研究结果表明,仅压缩并不能预测表示质量,并强调了形态驱动的结构发现的重要性以及如何使用频率来跨语言分配最终词汇。