论文

无需影子模型或保留数据的数据集使用推断

Dataset Usage Inference without Shadow Models or Held-out Data

模型评测安全与风险评测

摘要

我有多少数据用于训练机器学习模型?数据集使用推断 (DUI) 旨在通过估计数据集的哪些部分对模型的训练做出了贡献来回答这个问题。然而,现有的 DUI 方法依赖于在实践中很少成立的假设:它们需要训练昂贵的影子模型来模仿目标模型,并且它们假设可以访问已知的训练样本和确认在训练中不存在的分布内保留集。这些条件使得当前的方法对于现代大型模型和真实数据所有权纠纷来说不切实际。我们引入了一个实用的 DUI 框架来消除这些限制。我们的方法既不需要影子模型,也不需要真实的保留数据。相反,它生成合成的非成员样本,提取不同的成员信号,并将 DUI 视为混合比例估计问题,以估计在训练期间使用了候选数据集的份额。对大型图像生成模型的实验表明,我们的方法可靠地量化了数据集的使用情况,为数据所有者提供了一个实用的工具来确定他们的数据有多少用于训练模型。