论文
TINA+:通过扩散一致的无文本反演探索未学习扩散模型中的残余视觉知识
TINA+: Probing Residual Visual Knowledge in Unlearned Diffusion Models via Diffusion-Consistent Text-Free Inversion
摘要
尽管文本到图像的传播模型表现出非凡的生成能力,但概念擦除技术对于防止有害内容至关重要。现有的对抗性探针通过测试是否仍然可以恢复被删除的概念来评估这些方法。然而,现有的擦除和探测方法仍然主要以文本为中心,关注文本到图像的映射是否被切断,而忽略了相应的视觉知识是否仍然存在。为了从视觉角度研究这个问题,我们利用扩散反演来探讨生成轨迹是否可以重建被擦除概念的视觉实例。在空文本条件下,标准反演避免了文本路径,但放大了近似误差,阻碍了忠实的轨迹恢复。为了应对这一挑战,我们引入了 TINA+,这是一种扩散一致的无文本反转攻击,配备了基于优化的反转。我们还发现无约束扩散反演可能会发现虚假轨迹,甚至允许随机初始化的扩散模型来重建目标概念。这样的轨迹可能会错误地指示残留的视觉知识。因此,TINA+ 引入了扩散一致轨迹正则化来抑制这种故障模式。通过惩罚远低于预期扩散边际能量演化的轨迹,TINA+ 抑制了虚假的反转路径,同时保留了恢复已擦除概念的能力。十二种擦除方法、四种概念擦除任务和不同模型架构的实验表明,TINA+ 通过扩散一致的视觉轨迹可靠地探测残留视觉知识。这些结果提供了更有力的证据,表明当前的方法经常通过切断文本-图像链接而不是消除潜在的视觉知识来模糊概念。