论文

InGuard:迈向通用内部护栏,以实现安全的文本到图像生成

InGuard: Towards Generalized Inner Guardrail for Safe Text-to-Image Generation

模型推理解码与生成控制

摘要

现代文本到图像 (T2I) 模型可以根据任意用户提示生成高质量图像,但它们也可以轻松生成不安全工作 (NSFW) 内容。传统的外部护栏由两个组件组成:在生成之前检查风险的提示分类器,以及检查完全生成的图像的事后图像分类器。在此设计中,两个分类器都在生成管道之外运行,并且不使用模型自己的表示。这种分离会限制即时筛选的准确性,而图像侧检查仅在全部生成成本耗尽后运行。此外,即使可以调整它以产生安全图像,标记的提示也只能被拒绝。在这项工作中,我们提出了内部护栏(InGuard),这是一种安全框架,它在模型自身表示的管道内部工作,而基本模型参数保持不变。首先,风险分类器根据文本编码器的嵌入将每个提示分级为不安全、有风险或良性,无需外部语言模型。其次,SAGE(软门控非对称嵌入护栏)修改了风险提示的嵌入,旨在返回安全图像而不是拒绝图像。第三,潜在检测器在去噪过程中检查一步干净的潜在估计,达到接近图像级别的性能,并在检测到风险时停止生成。我们还构建了 RevGen 安全基准来评估现实条件下的 T2I 安全性:通过真实图像反向生成构建 10,000 个提示,并通过重写步骤提供受控知识产权 (IP) 角色,涵盖分级色情/血腥风险、分类 IP 风险和良性负片。在五个开放重量 T2I 模型中,InGuard 的安全率达到 97.9-98.8%,与外部护栏相当或超过,良性干扰减少 57.5-73.5%,参数减少约 3.7 倍,并跳过 50-55.6% 的去噪步骤。