论文

ScaleErasure:推理时间最小干预,用于下一代自回归图像生成中的精确概念擦除

ScaleErasure: Inference-Time Minimal Intervention for Precise Concept Erasure in Next-Scale Autoregressive Image Generation

模型训练模型编辑与遗忘

摘要

概念擦除旨在防止图像生成模型产生不安全的内容,同时保留其一般生成能力。与此同时,下一代自回归(AR)图像生成最近作为一种新的生成范式出现,其特征是下一代预测,其中概念擦除在很大程度上尚未被探索。在这种范式中,语义信息在早期被高度压缩,导致不安全和不相关的语义之间的严重纠缠。在本文中,我们提出了 ScaleErasure,一种执行最少干预的推理时间概念擦除方法。 ScaleErasure精确选择并引导与不安全概念最相关的预测logits,从而实现严重语义纠缠下的有效擦除。具体来说,ScaleErasure 根据不安全概念和相应的安全概念执行两次额外的前向传递,并利用它们的输出引导目标 logits 从不安全概念转向安全概念。为了实现精确和最小化的干预,logits 从规模、词元和比特通道三个维度进行选择和指导。实验表明,ScaleErasure 的性能优于下一代 AR 范式中的适应基线,实现了更精确的概念擦除,同时在很大程度上保留了一般生成能力。该代码可从 https://github.com/coziiizz/ScaleErasure 获取。