KinyaEmbed:通过多阶段课程训练进行基尼亚卢旺达语对比句子嵌入
KinyaEmbed: Contrastive Sentence Embeddings for Kinyarwanda via Multi-Stage Curriculum Training
摘要
我们推出了 KinyaEmbed,这是第一个专用于 Kinyarwanda 的句子嵌入模型,Kinyarwanda 是一种形态丰富的班图语,在卢旺达有超过 1200 万人使用。现有的多语言嵌入模型(例如 LaBSE、mE5-large 和 OpenAI text-embedding-3-large)在基尼亚卢旺达语上表现不佳,因为它们在 预训练 语料库中的代表性严重不足。 KinyaEmbed 基于 KinyaBERT-large 构建,并通过使用 MultipleNegativesRankingLoss (MNRL) 的四阶段课程进行训练:第 1 阶段利用卢旺达官方公报中的约 18,000 个释义对,具有三个温度范围;第 2 阶段对 715 个 NLLB 翻译的 MNLI 三元组进行微调,以实现蕴涵结构;第 3 阶段使用英语-卢旺达语 OPUS-100 翻译对对齐表示;第 4 阶段使用从 KinyaCOMET 中以质量阈值 0.8 过滤的 2,936 个高质量对进行细化。我们对 SemRel2024-rw 进行评估,并引入 Wiki-RW-STS,这是一种新的无污染卢旺达语 STS 基准,包含 300 对,源自卢旺达语维基百科。七检查点集成(all5+23A*2,最后阶段双加权)在 SemRel2024-rw 上实现了 Spearman \r{ho}=0.7298,超过 mE5-large 20.9%,超过 OpenAI text-embedding-3-large 41.0%。 KinyaEmbed 还在所有评估的模型中获得了最佳文档聚类轮廓分数 (0.2146)。所有检查点、KinyaCOMET 过滤对和 Wiki-RW-STS 基准都是公开可用的。