论文

RA-MoE:用于混合专家模型的多语言适应的路由对齐 微调

RA-MoE: Routing-Aligned Fine-Tuning for Multilingual Adaptation of Mixture-of-Experts Models

模型训练监督微调与指令调优

摘要

专家混合 (MoE) 模型可实现高效的 LLM 扩展,但使其适应非英语下游任务仍然具有挑战性。标准多语言微调在很大程度上忽略了它们的异构路由结构。在多个 MoE 模型和任务中,我们发现中间层具有很强的跨语言路由一致性,并且路由分歧与目标语言性能差距相关。受这一观察的启发,我们提出了 RA-MoE(路由对齐 MoE 微调),这是一个用于多语言 MoE 适应的三阶段框架。 RA-MoE 将并行示例分为四个正确性组 (cc/ci/ic/ii),并在中间层识别与任务相关的专家。然后,它有选择地将 ci 示例上的目标语言路由与成功的英语路由模式对齐,共同匹配分配给任务专家的总路由质量及其在他们之间的相对分配。跨三个 MoE 模型、三个下游任务和六种目标语言的实验表明,RA-MoE 始终优于标准 SFT 和强大的路由感知基线。进一步的分析证实了预期的路由变化,并揭示了中间层任务路由在很大程度上是跨语言共享和可转移的,为特定任务路由的跨语言可转移性提供了机制证据。