论文
超越原子标记:为语言模型预训练分解音节
Beyond Atomic Tokens: Factorizing Syllables for Language Model Pretraining
摘要
传统的分词器将文本表示为字符或统计派生的子词,忽略了音节的内部语音结构,并且通常需要大量词汇表。我们引入了 \textbf{Phonemic Tokenizer},这是一种针对越南语和中文的语言驱动的分词器,它将每个音节转换为国际音标,并将其分解为三个语音成分:开始、韵母和声调。这三个组件共同占据一个上下文位置,保留音节级序列长度,同时实现语音相关音节之间的表示共享。非语音和不受支持的单元通过字符级回退进行处理。这种确定性设计不需要依赖于语料库的词汇学习,并且只产生 112 个中文词汇和 256 个越南语词汇。内在评估表明,分词器在两种语言中都实现了更高的 Rényi 效率,以恰好为 1 的 Fertility 表示标准越南语音节词典中的每个条目,并且通常生成比现有预训练分词器更短的越南语序列。我们进一步在 \textbf{PhonemicBERT} 中实例化标记器,它结合了因式分解的组件嵌入并使用三个预测头重建完整的屏蔽音节。在受控的中文预训练设置下,PhonemicBERT-Zh 在不同的语言理解任务中与字符、子词和 SubChar 替代方案竞争或优于它们。 PhonemicBERT-Vi 还取得了与已建立的越南语和多语言预训练模型相比具有竞争力或更好的结果。这些结果将音素分解确立为原子和统计分段文本表示的紧凑、高效且可解释的替代方案。