论文
同名:探索文本到图像模型中的身份记忆
NAMESAKES: Probing Identity Memorization in Text-to-Image Models
摘要
当提示输入姓名时,文本到图像 (T2I) 模型会生成一些人的真实肖像,这引发了隐私问题。然而,目前区分生成的人脸是记忆的还是捏造的需要 真值 照片、访问训练数据或白盒访问模型内部结构,限制了适用性。我们引入了一种完全黑盒的行为探针,可以区分记忆的名称和未识别的名称,同时不需要参考照片或训练数据的先验知识。为了对这项任务进行基准测试,我们提供了 NAMESAKES 数据集,其中包含超过 1000 个不同知名度级别的公众人物的名字和面孔,以及不安的、不太出名的名字。在最先进的 T2I 模型上进行的实验表明,我们的探针可以显着预测身份记忆,并将记忆的名称与未识别的名称区分开来,并进一步深入了解模型系列之间的差异。