论文

验证文本到图像扩散模型中的概念遗忘

Certifying Concept Unlearning in Text-to-Image Diffusion Models

模型评测评测方法与指标

摘要

文本到图像(T2I)扩散模型中概念遗忘的现有评估主要依赖于通过自动对抗提示搜索获得的攻击成功率。然而,这些指标仅提供有限查询集的经验证据,而在更广泛的提示空间中留下的残余泄漏基本上是未量化的。这种限制可能会导致高估遗忘有效性并低估安全风险。为了解决这一差距,我们引入了一种用于 T2I 概念遗忘的新颖认证框架,该框架为残余概念泄漏提供了具有有限误差的高置信度保证。我们的方法将统计认证与沿着概念相关嵌入方向的最坏情况分析相结合,以在用户指定的置信水平下得出泄漏概率的明确上限。我们评估了三个主要概念类别(即 NSFW 内容、艺术风格和名人身份)的框架,以及六种最先进的忘却方法。经过认证的泄漏界限始终超出标准攻击成功率 16.2%,揭示了现有评估协议遗漏的大量残余风险。至关重要的是,我们的结果表明,基于经验攻击的评估可以显着低估残余泄漏,并将认证建立为对 T2I 扩散模型中概念遗忘进行可靠审核的必要补充。