论文
MameLoshnLM:意第绪语语言模型和评估基准
MameLoshnLM: Yiddish Language Model and Evaluation Benchmark
摘要
我们推出 MameLoshnLM,这是第一个专为依地语构建的开源 8B 参数语言模型。尽管意第绪语具有丰富的文本传统,但其有限的数字存在和可靠评估资源的稀缺限制了意第绪语语言建模的进展。现有的多语言语料库和基准通常不能很好地代表该语言,包含大量嘈杂的、机器翻译的和错误分类的文本。我们通过引入 Oytser(一个高质量的意第绪语预训练语料库,将当代网络原生资源与文学材料相结合)和 Kashes(一个涵盖翻译、语言分析、信息提取和语言理解的多任务基准)来解决这些差距。使用这些资源,我们继续预训练 Llama 3.1 8B 以获得 MameLoshnLM。在基准测试中的所有任务中,MameLoshnLM 的性能优于类似规模的开放基准。我们的分析表明,这些收益不仅是定量的:相对于通用多语言模型,MameLoshnLM 更好地捕获语言定义的词汇和形态模式,指出低资源语言的噪声网络规模多语言数据的更广泛的失败模式。我们的结果既为意第绪语 NLP 奠定了基础,也为历史丰富但数字代表性不足的语言的语言模型开发提供了实用模板。