论文

idSCD:通过语义相关描述符识别训练数据集

idSCD: Identifying Training Datasets through Semantic Correlation Descriptors

模型评测模型行为与机制分析

摘要

可以从训练期间产生的虚假相关性中识别数据集吗?我们认为,数据集在模型学习的语义相关结构中留下了数据集特定的痕迹:在数据集中具有预测性但与底层任务无关的偶然规律可以在训练过程中内化。我们利用这种洞察力来研究数据集级成员资格推断,超越依赖行为或分布证据(例如置信度得分、损失、利润、生成的样本或查询响应)的现有方法。我们引入了一种基于语义相关描述符(SCD)的白盒语义指纹识别方法,该方法捕获模型学习到的语义相关结构,并使其在数据集混合之间具有可比性。在受控的留一数据集诊断中,SCD 恢复数据集特定的更改,并将匹配与不匹配的数据集对完全分开。然后,我们提出一个实用的基于 SCD 的隶属度分数,仅使用模型的 SCD 和目标数据集的独立 SCD 来测试目标数据集是否是模型训练混合物的一部分,而不需要留一数据集模型。在三种不同的实验设置中,使用用于自然语言推理、情感分类和医学文本分类的数据集组,我们测试了基于 SCD 的成员推理的优点和局限性,以及数据集分割之间不同程度的语义分离和关键字支持。平均而言,基于此分数的分类器实现了最高性能和最低标准,优于黑盒基线 RMIA、Attack-P 和 LiRA,以及白盒 SIF 基线。这些结果表明,数据集成员资格可以通过内部语义相关性进行追踪,当数据集组暴露出不同的语义特殊性时,ROC-AUC 的最大相对增益超过 60%。