论文
当更多参数受到损害时:基础模型先验会在极端联邦异质性下放大最差客户端差异
When More Parameters Hurt: Foundation Model Priors Amplify Worst-Client Disparity Under Extreme Federated Heterogeneity
摘要
联邦学习(FL)越来越多地用于微调分布式私有数据的基础模型(FM)。社区很大程度上认为大规模预训练在联邦环境中起到了“水涨船高”的作用。然而,我们的实验表明,这些强大的先验可能会阻碍而不是帮助极端异质性下最弱势的客户。通过联合文本分类的受控实验,我们在四个非 IID 异质性级别上比较了 TextCNN(2.7M 参数)和具有低秩适应的 DistilBERT(LoRA,66M 参数)之间的最差客户端准确度。在极端标签偏差(alpha = 0.1)下,DistilBERT+LoRA 产生的最差客户端准确度差距为 50.1%,比 TextCNN 的 32.2% 差距大 56%,尽管参数增加了 25 倍并且进行了广泛的预训练。在中等异质性 (alpha >= 0.5) 下,模式相反:FM 几乎消除了差距。我们称之为 FM 公平悖论。我们进一步表明,反加权 LoRA 聚合方法 (FedAvgW) 不能解决这种差异,表明单独聚合重新加权可能是不够的。我们的结果强调,在医疗保健和教育等高风险联邦环境中部署基础模型之前,需要建立明确保护少数群体客户的机制。