论文

使用稀疏 MoE 微调 和思想链 蒸馏 进行最先进的阿拉伯语言建模

State-of-the-Art Arabic Language Modeling with Sparse MoE Fine-Tuning and Chain-of-Thought Distillation

摘要

本文介绍了阿拉伯语-DeepSeek-R1,这是一种应用程序驱动的开源阿拉伯语 LLM,它利用稀疏的 MoE 主干来解决代表性不足的语言的数字公平差距,并在整个开放阿拉伯语 LLM 排行榜 (OALL) 上建立了一个新的 SOTA。我们的四阶段 CoT 蒸馏 方案将阿拉伯语特定的语言验证和区域道德规范集成到 372M 词元、污染控制的 80/20 阿拉伯语-英语训练混合物中。 rabbit-DeepSeek-R1 在七个基准 OALL 套件中取得了最高平均分,同时建立了 SOTA 或接近 SOTA,包括在以语法为中心的 MadinahQA 上的主导结果(大幅超越 GPT-5.1 和 OALL 领导者)、以安全为导向的 AraTrust、多功能 AlGhafa 和检索增强 ALRAGE。我们的结果表明,稀疏 MoE 架构、具有明确阿拉伯语言检查的文化信息 CoT 蒸馏 以及战略双语数据管理的结合,使开源改编模型能够在评估综合语言特定任务的大多数基准上系统地优于专有前沿系统 GPT-5.1:阿拉伯语 LLM 的首次此类演示。这些发现表明,Arabic 在当前 LLM 生态系统中的性能缺陷很大程度上源于专业化不足,而不是架构限制,并且开放推理模型的参数高效适应可以在无需工业规模预训练成本的情况下产生突破性的 SOTA 性能。 rabic-DeepSeek-R1 为主权和特定领域的语言技术建立了一个经过验证且可复制的框架,表明对稀疏 MoE 骨干进行战略性、基于文化的适应提供了一条可行且具有成本效益的途径,可以在低资源语言的标准化基准上实现破纪录的性能。