论文

循环去噪揭示了扩散模型中的超稳定记忆

Cyclic Denoising Reveals Ultrastable Memories in Diffusion Models

模型评测安全与风险评测

摘要

我们引入循环去噪——在受控噪声幅度下重复前向和反向扩散——作为图像扩散模型的提取攻击。受无序固体中随机组织的启发,循环去噪暴露了标准采样基本上无法访问的学习分布区域。动力学将样本推向具有广泛稳定性谱的吸引子。最深的吸引子是超稳定的:它们在几乎完全损坏后重新生成,并持续经历数千个噪声-去噪周期。其中许多吸引子对应于记忆的训练图像,包括库存照片、品牌水印和网络爬行工件。该攻击仅需要采样器级别的控制,不需要梯度、权重检查、提示、图像描述或训练数据的先验知识。与依赖于大规模提示生成和事后相似性或成员推理过滤的生成和过滤攻击不同,我们的主要协议是完全无条件的。我们在稳定扩散 v1.4 和像素空间 DDPM 中演示了这一现象,显示了潜在扩散模型和像素空间扩散模型的一致行为。在噪声幅度上,我们观察到类似屈服的转变:低幅度循环产生微不足道的吸收不动点或极限环,而较大的幅度会导致结构记忆吸引子盆地中的重排、盆地跳跃和长期俘获。我们还观察到恢复的吸引子集的分层部分吸收、瞬时稳定盆地和跨初始条件普遍性。因此,我们的结果表明,循环去噪既是一种受物理启发的生成景观探索,也是一种记忆审核的实用工具,对隐私、版权合规性和模型指纹识别具有影响。