论文

对图像生成模型 预训练 数据的黑盒成员推理攻击

Black-box Membership Inference Attacks on the Pre-training Data of Image-generation Models

模型评测安全与风险评测

摘要

基于扩散的图像生成模型的快速发展引起了人们对涉及人类创建数据的潜在版权和隐私侵权的严重担忧。成员推理攻击 (MIA) 已成为一种很有前途的工具,用于识别 模型训练 期间未经授权的数据使用。现有方法通常评估模型对受干扰的可疑图像进行去噪的能力,作为会员状态的指标。然而,这些特征的判别能力高度依赖于模型记忆的程度,并且当应用于较少暴露的数据(例如,预训练 数据)时,其判别能力会显着恶化。尽管有几种方法试图通过利用内部模型特征来增强检测,但这些特征在主流闭源图像生成平台中通常无法访问,限制了它们的实用性。在本文中,我们证明,分析黑盒扩散模型如何对目标图像进行去噪以及相应的扰动文本指令可以揭示更独特的隶属线索。基于这一见解,我们提出了一种黑盒成员推理攻击框架(名为 SD-MIA),该框架利用跨模态数据扰动机制来检测扩散模型中的 预训练 数据。我们对公共基准数据集和新构建的数据集进行了广泛的实验,每个数据集都包含具有相同分布的 预训练 会员和非会员样本。实验结果表明,与现有基线相比,SD-MIA 实现了卓越的性能,包括那些具有访问内部模型特征的不公平优势的基线。