论文

公共数据集的差异化私人混合可改善私人学习

Differentially Private Mixing of Public Datasets Improves Private Learning

模型训练预训练

摘要

许多机器学习应用程序涉及敏感数据,因此需要差分隐私 (DP) 下的训练。然而,DP 训练通常会降低模型的实用性。在某些情况下,首先在“公共”数据上预置训练模型,然后在敏感数据上使用 DP 进行微调可以减少效用的下降。然而,其成功取决于所选公共数据集与敏感数据的相关程度。我们引入了第一个管道,它私下学习多个公共数据集的混合,以便针对给定的敏感下游任务进行预训练。我们的主要见解是,我们可以通过私下学习低维线性模型来私下找到多个公共数据集的最佳组合。我们在用于 X 射线分类的 NIH 数据集和用于语言建模的 ENRON 电子邮件数据集上测试了我们的方法。应用我们的方法找到定制的 X 射线数据集混合物,对 NIH ChestX-ray14 数据集中的疾病进行预训练,与基线相比,我们在隐私预算中的宏观 AUC 提高了高达 0.037,在 $ε=1$ 的心脏肥大方面的相对 AUC 增益高达 +22.8%。对于 ENRON 数据集上的 DP 训练,我们混合的 The Common Pile(公共域文本数据集)上的训练之前的测试困惑度相对于基线混合物降低了 16%。