论文
调查叙事图像生成中的社会偏见
Investigating Social Bias in Narrative Image Generation
摘要
文本到图像(T2I)生成模型越来越多地嵌入到媒体内容创建和教育等应用中,引发了人们对其输出如何再现社会偏见的担忧。之前的工作表明,T2I 模型表现出社会偏见,但现有的评估主要集中在照片生成任务上。因此,目前尚不清楚这种偏见是否以及如何在更具叙事性的视觉格式中表现出来,例如故事板和漫画,其中角色和事件在多个面板上呈现。在这项工作中,我们通过将基于文本的偏见评估框架 BBG 应用于图像生成,比较了六个 T2I 模型中照片、故事板和漫画生成的偏见表达。我们的结果表明,专有模型在照片生成中平均产生 25.9% 的偏差输出,在故事板生成中偏差输出增加了 9.6pp,在漫画生成中偏差输出增加了 18.2pp。我们还发现,照片主要通过微妙的视觉线索来编码偏见,而故事板和漫画则通过事件排序、角色定位、叙事分辨率和文本元素更明确地揭示偏见。这些发现表明,在照片生成中不太明显的偏差可能会在叙事视觉格式中显现出来,这凸显了用照片生成之外的多种视觉格式评估 T2I 系统的重要性。