论文

大语言模型 与混合专家的冲突感知联合 微调

Conflict-Aware Federated Fine-Tuning of Large Language Models with Mixture-of-Experts

模型训练监督微调与指令调优

摘要

大语言模型 (LLM) 的连续扩展会产生高昂的计算成本,这使得 Mixture-of-Experts (MoE) 成为通过稀疏激活实现高效 微调 的可扩展替代方案。虽然联邦学习 (FL) 作为隐私保护协作优化的范例而出现,但在数据异构性下将 MoE 集成到 FL 可能会引发相互冲突的专家优化。特定于客户的数据分布迫使相同索引的专家在不一致甚至冲突的特征标签相关性下进行优化。这种不匹配会在聚合过程中引起破坏性干扰,从而破坏优化轨迹的稳定性并降低模型性能。为了解决这个问题,我们提出了 FC-MoE,这是 MoE 微调 的联合冲突感知框架。它采用重要性感知加权方案来优先考虑可靠的本地更新,并利用梯度共识投影来抑制冲突更新,确保稳定的全局优化路径。此外,本地知识保留机制通过重新锚定特定领域的残差进一步保留专业的客户专业知识。大量实验表明,FC-MoE 可加速收敛并增强非 IID 联合环境中的全局和局部模型性能。