论文

NE-BERT:九种东北印度语言的多语言模型

NE-BERT: A Multilingual Language Model for Nine Northeast Indian Languages

模型训练预训练

摘要

大型预训练语言模型在不同语言中表现出了卓越的能力,但代表性严重不足的低资源语言仍然被边缘化。我们提出了 NE-BERT,这是一种特定领域的多语言编码器模型,它训练了大约 830 万个句子,涵盖 9 种东北印度语言和 2 种锚语言(印地语、英语),这是一个语言多样化的区域,在现有多语言模型中的代表性极少。通过采用加权数据采样和自定义 SentencePiece Unigram 分词器,NE-BERT 在所有 9 种东北印度语言中的表现优于 IndicBERT-V2 和 MuRIL,平均困惑度分别降低 15.97 倍和 7.64 倍,分词能力比 mBERT 提高 1.50 倍。我们通过积极的上采样策略解决了 Pnar(1,002 个句子)和 Kokborok(2,463 个句子)等资源极少的语言中的关键词汇碎片问题。对词性标记的下游评估验证了三种东北印度语言的实用性。我们在 CC-BY-4.0 下发布 NE-BERT、测试集和训练语料库,以支持印度东北部社区的 NLP 研究和数字包容。