论文
扩展基于 Ge'ez 的非洲语言词汇:阿姆哈拉语和提格里尼亚语的比较研究
Expanding the Lexicon of Ge'ez Based African Languages: A Comparative Study of Amharic and Tigrinya
摘要
XLM-R 等多语言预训练语言模型对于主要语言表现良好,但在资源匮乏的 Ge'ez 脚本语言中表现不佳,这主要是因为以拉丁脚本为中心的分词器将其单词拆分为许多子词。我们引入了 VEXMLM,这是针对阿姆哈拉语和提格里尼亚语的 XLM-R 的词汇扩展变体。我们在单语语料库上训练特定于语言的 SentencePiece 分词器,用 30k Ge'ez 脚本子词扩展 XLM-R 的词汇量,并将每个新嵌入初始化为预训练嵌入的平均值。 VEXMLM 经历两个阶段的训练:(1) 在单语语料库上继续进行掩码语言建模,(2) 在问答和命名实体识别(阿姆哈拉语和提格里尼亚语)和情感分析(阿姆哈拉语)上监督 微调。相对于 XLM-R,VEXMLM 将这两种语言的标记器生成率降低到了 XLM-R 和 Glot500 的水平以下,分别降低了 28.0%(阿姆哈拉语)和 45.9%(提格里尼亚语)。在下游,它相对于 XLM-R 略微提高了命名实体识别,在提取问答方面的得分低于 XLM-R,并且在情感分析方面具有可比性。 Tigrinya NER 的消融表明,词汇扩展本身会降低词汇表外单词(XLM-R 的分词器无法表示或分割成比扩展分词器更多的单词)的准确性,并且需要持续预训练才能使扩展模型超过基线。因此,词汇扩展使得 Ge'ez 脚本标记化更加高效,而其下游效益取决于任务以及通过持续预训练来适应新的嵌入。资源:GitHub 存储库 |拥抱脸模型。