论文

擦除还是侵蚀?评估未学习的文本到图像扩散模型中的成分退化

Erasure or Erosion? Evaluating Compositional Degradation in Unlearned Text-To-Image Diffusion Models

模型评测安全与风险评测

摘要

事后遗忘已成为一种实用机制,用于从大型文本到图像扩散模型中删除不需要的概念。然而,之前的工作主要通过擦除成功来评估遗忘;它对更广泛的生成能力的影响仍然知之甚少。在这项工作中,我们通过组合文本到图像生成的视角对概念遗忘进行了系统的实证研究。我们专注于 Stable Diffusion 1.4 中的裸露去除,使用 T2I-CompBench++ 和 GenEval 以及已建立的遗忘基准评估了一组不同的最先进的遗忘方法。我们的结果揭示了遗忘有效性和组成完整性之间的一致权衡:实现强擦除的方法经常会导致属性绑定、空间推理和计数方面的大幅退化。相反,保留组合结构的方法通常无法提供可靠的擦除。这些发现凸显了当前评估实践的局限性,并强调需要忘记目标,这些目标明确解释了除有针对性的抑制之外的语义保留。