论文

Obliviate:从自回归图像生成模型中删除概念

Obliviate: Erasing Concepts from Autoregressive Image Generation Models

模型训练模型编辑与遗忘

摘要

生成式人工智能模型的广泛采用加剧了人们对滥用的担忧,包括创建不安全或令人不安的图像。为了缓解此类问题,已经提出了几种概念擦除方法,以从多模式生成模型中删除有害内容。然而,尽管这些模型在最近统一多模态架构的趋势中的相关性越来越大,但自回归图像生成的概念擦除在很大程度上仍未被探索。在这项工作中,我们通过引入 Obliviate 来填补这一空白,这是一种用于自回归图像生成的基于指导的概念擦除方法。我们的方法建立在三个关键的设计选择之上:基于 KL 的视觉标记分布监督、完全自回归生成轨迹的轨迹级更新以及用于稳定目标构建的对齐视觉前缀。我们在三种最先进的自回归文本到图像模型 Liquid、Emu3-Gen 和 Janus-Pro 上评估 Obliviate,涵盖露骨内容、图形暴力和品牌图像的删除。 Obliviate 始终优于当前的替代方案,将防御性 RAB 基准的裸体从 91.58 降低到 3.15,同时保持整体模型效用。