论文

MoganBert-TR:土耳其编码器基础模型,通过 CLM 到 MLM 课程从头开始训练

MoganBert-TR: A Turkish Encoder Foundation Model Trained from Scratch with a CLM-to-MLM Curriculum

模型训练预训练

摘要

土耳其编码器模型采用了现代架构,同时将预训练目标固定在掩码语言建模上。本文介绍了 MoganBert-TR,这是一个在特定于语言的过滤语料库上从头开始训练的 149M 参数土耳其编码器基础模型,以及从中派生的嵌入模型 (MoganBert-Embed)。 MoganBert-TR 通过两阶段的 CLM 到 MLM 课程训练了超过 237.3B 个词元:首先进行因果语言建模,其余部分进行掩码语言建模,并在 WSD 计划的稳定阶段内进行过渡。在同等步长预算下的受控消融中,该设计在土耳其 MS MARCO 检索上的性能比纯 MLM 高 2.7-3.7 倍;测量的机制是嵌入几何学,其中单一方向吸收纯传销下 28.1% 的方差,而课程下为 11.9%。然后,长上下文扩展和学习率衰减在共享前缀后分为两个分支:在 1024 个上下文中运行衰减的最后部分,将 5 个配对种子的 TrGLUE 平均值提高了 0.49 +/- 0.26 点 (p = 0.013),并以约 4.3% 的额外成本击败了模型汤替代方案 0.75 点。 MoganBert-TR 在 TrGLUE 上获得 78.41 分,是土耳其 ModernBERT 模型中最好的,在 TabiBench 上获得 77.73 分,在代码检索方面领先八个类别中的两个类别(比 TabiBERT 高出 3.62 分)。由教师 蒸馏 和多信号对比 微调 制作的 MoganBert-Embed 在 MTEB(土耳其语)总体平均分中排名第一,在 MTEB(土耳其语)学生模型中排名第一,并以较小的 51 倍的骨干网络达到了其 7.57B 参数教师分数的 99.5%。附带的 50,048 个词元分词器在两个独立测试集的压缩和生育力方面优于所有比较的土耳其分词器。权重、分词器、嵌入模型和评估代码:https://huggingface.co/moganai