论文
音素来救援:基于国际音标的多语言标记化
Phonemes to the Rescue: Multilingual Tokenization Based on International Phonetic Alphabet
摘要
多语言模型通常会表现出跨语言的性能差异,这种差异早在标记化阶段就可能出现。广泛使用的子词分词方法有利于高资源语言,而无分词器的方法仍然会为具有更高字节/字符比率的脚本产生更长的序列。为了解决这些缺点,我们建议使用国际音标(IPA)作为多语言分词器的与语言无关的输入表示。 IPA 提供紧凑的符号库存、更大的跨语言字符重叠以及跨语言的更平衡的每字符字节分布。我们在 24 种语言和 14 种脚本中训练匹配的文本与 IPA 子词分词器,并证明 IPA 分词器持续提高分词质量,特别是对于非拉丁脚本,并更有效地泛化到未见过的语言和脚本。