无辜面板,仇恨故事:评估和检测多轮视觉故事生成中的仇恨意图
Innocent Panels, Hateful Stories: Evaluating and Detecting Hateful Intent in Multi-Turn Visual Story Generation
摘要
图画书和漫画长期以来一直被用来传播仇恨叙事,因为它们即使是儿童也很容易理解,臭名昭著的纳粹宣传图画书 \emph{Der Giftpilz} 就是一个例子。最近,Gemini 和 GPT-Image 等前沿文本到图像 (T2I) 系统已经实现了对话生成,角色和场景在各个回合中保持一致,从而制作出可恨的视觉故事,即共同传达可恨叙事的有序图像组,制作成本低廉且可扩展。尽管之前的工作已经研究了 T2I 系统生成的仇恨内容,但它侧重于个人图像,而很大程度上没有探索群体层面的仇恨含义。我们的目标是解决这一差距。具体来说,我们引入了 \texttt{HatefulStoryPrompts},其中包含跨两种语言和三种视觉风格的 55 个仇恨故事的 330 个多回合配置,并在 4,950 次尝试中评估了 5 个前沿模型。每个模型都完成了80%以上的故事,最强者达到99.0%。我们进一步在 \texttt{HatefulVisualStory} 上评估现有的审核系统,这是一个由 969 个仇恨图像集和 990 个良性对照组成的人类标记数据集,发现它们经常错过群体级别的仇恨含义:专用安全模型最多可实现 34.9% 的召回率,而强大的视觉语言模型可达到 67.5%。最后,我们提出互补的主动防御和后代防御。交互感知监视器在仅提示会话中实现了 97.3% 的召回率,在用户提供第一张图像时实现了 92.6% 的召回率,而联合分析完整图像组的后生成方法则达到了 80.2%。我们的工作表明,随着图像生成从孤立的输出发展到连贯的视觉叙述,安全性也必须相应发展,从每个图像的调节发展到对交互和图像关系的状态推理。