论文
FedMIX-P:混合本地和全局预处理器以进行联合视觉和语言模型训练
FedMIX-P: Mixing Local and Global Preconditioners for Federated Vision and Language Model Training
摘要
自适应预处理器可加速模型训练,但即使在同一模型上评估梯度,异构客户端几何结构也会使联合更新产生偏差。单独的轮开始同步无法防止这种不匹配在本地训练期间再次出现。我们提出 \texttt{FedMIX-P},它在每个局部步骤中混合共享预处理器和局部预处理器,保留局部自适应,同时将均方算子失配减少 $λ^2$ 倍。对于具有随机梯度和部分参与的平滑非凸目标,我们使用合适的步长和与水平相关的混合权重建立 $O(R^{-1/2})$ 平稳性界限,而不需要局部预处理器彼此收敛。两个客户端的反例表明,固定正混合可以保留非平稳不动点。该理论涵盖有界线性对称正定预条件子。跨视觉和语言任务的 SOAP、Sophia 和 Muon 变体的实验表明,相对于相应的本地优化器有所改进,包括高达 $19.47$ 个百分点的准确率提升以及 60M--350M 语言模型的较低验证损失。完全非线性和基于动量的更新需要单独分析。