论文

通用框架:生成模型的跨模态成员推理

One Framework for All: Cross-Modal Membership Inference for Generative Models

模型评测安全与风险评测

摘要

跨文本到文本、文本到图像和图像到文本模式的大型生成模型已被证明会带来重大的隐私风险。一种基本威胁是成员推理攻击 (MIA),其目的是确定模型的训练集中是否使用了给定的数据点。尽管之前的工作已经针对这三类生成模型研究了 MIA,但现有方法将它们孤立地对待并且不能交叉适用,从而限制了它们在现实世界中的效用。为了解决这一局限性,我们提出了第一个针对统一成员推理框架的全面研究,该框架适用于文本到文本、文本到图像和图像到文本模式。我们的方法基于与模态无关的关键观察:生成模型的输出分布可以近似其训练数据分布。利用这一特性,我们对共享嵌入空间中模型生成的输出和辅助非成员样本的分布进行建模,并通过似然比测试执行隶属度推断。我们在部分知识和零知识威胁模型下在严格的黑盒设置中进行了广泛的实验,并根据 微调 和 预训练 数据评估成员资格推断。实验结果证明,与现有最先进的方法相比,我们的方法具有优越的性能,现有的最先进的方法通常针对单个模型类进行优化。