论文

基于 MoE 的大型语言模型的任务感知联合微调

Task-Aware Federated Fine-Tuning for MoE-based Large Language Models

模型训练监督微调与指令调优

摘要

专家混合 (MoE) 已成为大型语言模型 (LLM) 广泛采用的架构,因为它提高了模型容量,同时通过稀疏专家激活限制了计算开销。这一特性使得基于 MoE 的大语言模型对于资源受限的分布式环境特别有吸引力。然而,在异构客户数据下,基于 MoE 的大语言模型的联合微调仍然具有挑战性。由于客户端通常对应不同的任务偏好,直接聚合其本地更新可能会削弱专家的专业化,并在共享专家上引入冲突的更新方向。为了应对这些挑战,我们提出了 FedTAR,一种用于基于 MoE 的大语言模型的任务感知联合微调方法。 FedTAR 通过路由输出建立本地更新和任务偏好之间的关联。具体来说,我们将奇异值分解(SVD)应用于路由特征和局部更新,以提取低维任务坐标和更新方向。基于任务坐标,FedTAR 在具有相似任务偏好的客户端之间执行集群内聚合,并在不同任务组之间执行集群间聚合。然后通过学习的任务到更新映射重建聚合更新,确保最终更新与特定于任务的优化方向保持一致。通过这种方式,FedTAR 保留了专家的专业性并减轻了异构客户端之间的破坏性干扰。我们在不同非 IID 设置下的四个基准任务上评估 FedTAR。实验结果表明,FedTAR 始终优于强大的联邦微调基线,并实现了最先进的性能。