论文

已删除但可利用:黑盒嵌入感知提示针对未学习的文本到图像扩散模型

Erased but Exploitable: Black-box Embedding-Aware Prompting Against Unlearned Text-to-Image Diffusion Models

模型评测安全与风险评测

摘要

机器遗忘的目的是从预训练的文本到图像扩散模型中删除特定概念,但已经引入了几种白盒和黑盒攻击以使模型生成此类未学习的概念。然而,这些攻击并没有假设一个现实的威胁模型,即它们要么假设可以访问模型权重,要么导致即使通过简单的基于规则的防护也可以轻松检测到的胡言乱语的对抗性提示。我们的目标是在本文中解决这一差距。我们引入了 BEAP,这是一种黑盒、嵌入感知的对抗性提示攻击,它利用 大语言模型 (LLM) 迭代生成有效的对抗性提示并利用此类隐藏漏洞。 BEAP 在文本空间中执行嵌入感知搜索,结合多个奖励信号:未学习的概念存在、文本图像对齐和图像质量,以完善生成的提示。与以前的攻击方法不同,BEAP 在生成高质量图像的同时,使其提示无法被安全过滤器检测到。在五种遗忘方法中,BEAP 在 OpenNSFW2 评估中实现了 97.8% 的宏观平均 ASR,超出白盒 UDA 基线 41.6 个百分点(56.2% 至 97.8%)。按照完整的 100 个查询预算计算不成功的搜索,在此标准下,BEAP 平均每个评估提示使用 32.1 个图像生成查询。