论文

SARA:通过语义锚定路由对齐解锁专家混合中的多语言知识

SARA: Unlocking Multilingual Knowledge in Mixture-of-Experts via Semantically Anchored Routing Alignment

模型训练监督微调与指令调优

摘要

稀疏专家混合 (MoE) 架构已成为一种影响力越来越大的范式,因为它们在参数可扩展性和计算效率之间提供了战略平衡。然而,低资源语言由于缺乏高质量的训练数据,通常会将其词元路由给不同的专家,而不是主要由高资源输入激活的专家,这限制了跨语言专家共享。这种跨语言路由差异因此阻碍了它们在多语言环境中的功效。为了解决这个问题,我们提出了 SARA(语义锚定路由对齐),这是一个旨在将专业功能从作为锚点的高资源语言转移到低资源语言的框架。 SARA 使用对称 Jensen-Shannon (JS) 发散约束将多语言输入的路由分布与高资源语义锚明确对齐。与对输出 logits 进行操作的传统 蒸馏 方法不同,SARA 直接对齐 MoE 层的内部路由分布,从而鼓励跨语言专家选择的机械一致性。我们在 2 个 LLM 上跨 5 种低资源语言和 3 个基准进行了实验。实验结果表明,SARA 的性能优于标准指令调整,例如,在 Global-MMLU 上的 Qwen3-30B-A3B 上提高了 0.8%,在 Phi-3.5-MoE-instruct 上提高了 1.2%。进一步的分析表明,SARA 有效地解决了低资源语言的性能瓶颈,提供了一种可扩展的途径来增强稀疏架构中的多语言能力。