论文
困惑预测保护:在联合参数高效微调中选择预训练骨干网以实现最差客户端公平性
Perplexity Predicts Protection: Choosing Pretrained Backbones for Worst-Client Fairness in Federated Parameter-Efficient Fine-Tuning
摘要
联合学习允许多方在不汇集数据的情况下训练共享模型,但即使该组的平均准确度看起来不错,数据远少于其他客户的客户最终也可能得不到很好的服务。我们询问预训练主干的选择是否会影响 LoRA 微调下的情况,以及目标文本上每个单词的困惑度是否可以预测哪个主干在联合训练开始之前帮助情况最差的客户端。我们在三个文本分类数据集和三个类似大小的主干网络(RoBERTa、BERTweet、PubMedBERT)上运行了 313 项实验,每个实验都与相同数据分割上的特定任务基线进行比较。较低困惑度的主干网始终为表现最差的客户端带来更大的收益,九个数据集-主干网对的排名相关性为 -0.87;一位坚持分析的骨干证实了这一模式。 Ditto 的个性化仅弥补了单独训练和完全联合训练之间 4-12% 的差距,而消除聚合则完全消除了这一优势。客户的更新也没有显示出与该组织的更新相冲突的迹象;两者接近正交,排除了对这一失败提出的一种解释。实际上:在选择主干之前测量任务文本样本的困惑度,并且不要依赖个性化来保护数据匮乏的客户端。我们发布代码、预测和完整结果供其他人测试。