论文

Gaussian Core LoRA:用于广泛概念擦除的分布感知动态适应

Gaussian Core LoRA: Distribution-Aware Dynamic Adaptation for Broad Concept Erasure

模型训练模型编辑与遗忘

摘要

概念擦除旨在抑制文本到图像扩散模型中不安全、隐私敏感或不需要的生成,同时保留良好的语义、视觉质量和部署效率。现有的基于适配器的方法,例如低秩适应(LoRA),通常会冻结扩散主干并学习轻量级参数更新,以引导生成远离目标语义。然而,这些方法通常为每个目标概念分配静态语义擦除方向。对于广泛而复杂的目标概念来说,这种假设过于粗糙,因为一个概念通常包含涉及不同对象、场景或关系的多个潜在语义原型,并且需要不同的局部擦除方向。单个 LoRA 更新可以平均这些异构擦除需求,从而导致困难原型的擦除不足和附近良性语义的过度编辑。为了解决这个限制,我们提出了 Gaussian Core LoRA,一种分布感知的低秩适应框架。它在提示特征空间中拟合高斯混合模型,以估计目标概念内的潜在语义原型。在推理过程中,每个输入提示都被投影到该特征空间中以计算其高斯后验责任,这使核心生成器产生共享 LoRA 秩空间的提示特定、范数有界的残差重新配置。这使得能够使用单个轻量级适配器进行原型自适应擦除。与每个指标的最强基线相比,Gaussian Core LoRA 平均攻击成功率 (ASR) 降低了 7.95%,COCO Fr'echet 起始距离 (FID) 降低了 14.72%,CLIP 得分提高了 4.98%。进一步的实验显示了对抗性提示的鲁棒性、多身份和多样式擦除的可扩展性以及与 SDXL 和 FLUX 的兼容性。