论文
文本到图像模型中的有害内容生成:功能和审核限制
Harmful Content Generation in Text-to-Image Models: Capabilities and Moderation Limitations
摘要
文本到图像生成模型可以产生高度逼真的图像,但也引起了对有害滥用的担忧。尽管存在安全机制,但对其针对现实攻击的有效性的系统评估仍然有限。我们使用自动化管道对五个开放文本到图像模型的有害内容生成进行了系统评估,该管道将合法的新闻标题转换为针对露骨内容、暴力/血腥、有害刻板印象、自残和仇恨言论的不安全提示。我们评估具有内置安全机制的标准模型和绕过内容限制的社区微调变体。对 1,500 张生成图像的人工评估显示,有害内容生成率很高:与血腥相关的提示为 89.2%,露骨性内容为 47.6%,有害刻板印象为 43.6%,仇恨言论为 46.0%,自残(主要通过图形暴力)为 34.5%。模型显示出生成暴力和刻板内容的强大能力,而社区微调的变体特别容易受到露骨性提示的影响。在有害的刺激下,生成质量在很大程度上得到了保留,产生了足够保真度的图像,从而带来虚假信息和滥用的风险; FLUX.1-dev 在 30.9% 的情况下生成清晰逼真的有害图像。我们进一步评估自动审核系统,并发现大量检测差距,使不安全的图像能够逃避过滤。最后,我们评估了合成图像检测器,并表明仅在良性数据集上训练的模型在显式内容上表现较差,而更多样化的训练数据改善了检测,突出了当前方法中的语义分布差距。这些发现暴露了当前一代保障措施、审核系统和合成图像检测的局限性,强调需要更强有力的防御措施来防止大规模滥用。
