论文

UB-SMoE:基础模型资源自适应联合 微调 的通用平衡稀疏专家混合

UB-SMoE: Universally Balanced Sparse Mixture-of-Experts for Resource-adaptive Federated Fine-tuning of Foundation Models

摘要

异构 LoRA 排序方法通过根据计算能力分配特定于客户端的排序来解决基础模型联合 微调 中的系统异构性。然而,这些方法仅实现了边际计算节省,因为密集的前馈计算占主导地位。稀疏专家混合 (SMoE) 通过条件计算提供了一种有前途的替代方案,但我们发现,其对异构联合设置的简单应用引入了两个关键的不一致之处:(i) 专家利用率不平衡和 (ii) Top-K 路由的不可微性。我们的收敛分析表明,这些不一致会导致收敛性下降,特别是对于资源有限的客户而言。为了应对这些挑战,我们提出了通用平衡稀疏专家混合(UB-SMoE),它引入了动态调制路由(DMR)来重新平衡专家利用率,并引入通用伪梯度(PG)来重建非激活专家的学习信号。这些机制形成了一个自我强化的循环,可以保持专家在异构客户端上的生存能力。基准实验表明,与现有的异构 LoRA-rank 方法相比,UB-SMoE 在低资源客户端上实现了高达 $45.0\%$ 的计算减少,同时将其性能提高了 $8.7 \times$。