论文
低资源专家组合 LLM
Mixture of Experts for Low-Resource LLMs
摘要
专家混合 (MoE) 架构可实现高效的模型扩展,但对跨代表性不足的语言的专家路由行为仍然知之甚少。我们使用希伯来语作为形态丰富、资源匮乏的测试平台,分析了两个架构不同的 MoE 模型(纯 Transformer (Qwen3-30B-A3B) 和混合 Mamba-Transformer (Nemotron-3-Nano-30B-A3B))中的路由动态。两个预训练模型都表现出\emph{深层路由崩溃}:使用熵在最后层中急剧下降,并且标记集中在狭窄的专家子集上,这种模式在英语中基本上不存在。平衡双语数据上的持续 预训练 (CPT) 基本上纠正了这种不平衡,增加了熵并将路由转向共享的、与语言无关的专家;单独有监督的 微调 (SFT) 实现的校正不太完整。将分析扩展到日语,揭示了数量上一致的崩溃特征,提供了跨语言证据,表明这种现象是 预训练 代表性不足的系统性后果,而不是任何语言固有的属性。路由改进与一致的下游基准增益相关,将路由熵和专家专业化定位为教育部系统中多语言能力的原则诊断。