论文

使用迭代自我改进密码本进行安全自回归图像生成

Safe Autoregressive Image Generation with Iterative Self-Improving Codebooks

模型训练模型编辑与遗忘

摘要

与在连续潜在空间中运行的基于扩散的模型不同,自回归统一多模态模型通过顺序预测离散视觉标记来生成图像。这些标记源自将嵌入映射到量化视觉模式的密码本。类似语言的架构使统一的多模态模型能够有效地捕获文本条件信息以进行生成,从而使它们有望用于文本到图像的任务。这也提出了一个有趣的问题:以这种自回归方式生成的图像有多安全?在这项工作中,我们提出了用于安全自回归生成的迭代自我改进密码本。我们利用统一多模态模型本身的理解和判断能力来识别不安全的生成图像,而无需人工注释。随后,固定码本中的固有表示以消除有害的映射。我们的方法包括两个步骤:首先,我们使用统一模型来识别不安全的世代并构建相应的有害和安全的图像文本对。这些对用于构建有害空间并指导码本的更新,从而消除有害输出。其次,我们使用安全的图像文本对在无害空间内的码本上执行自适应 微调 以确保生成图像的质量。重复这两个步骤,直到观察不到进一步的改进,从而生成安全增强的模型密码本。在没有额外的外部反馈的情况下,模型的安全性得到迭代提高。