论文

GLEaN:一种面向公众理解的文生图偏见检测方法

GLEaN: A Text-to-image Bias Detection Approach for Public Comprehension

模型评测鲁棒性、公平性与可信度评测

摘要

文生图(T2I)模型及其编码的偏见日益塑造着公众接触到的视觉媒体。尽管研究者在T2I系统的偏见测量、审计与缓解方面已产出丰富成果,这些方法主要面向技术利益相关方,在公众可读性上留下空白。我们提出GLEaN(Generative Likeness Evaluation at N-Scale),一个基于肖像的可解释性流水线,旨在让T2I模型偏见对广泛受众在视觉上可理解。GLEaN包含三个阶段:从身份提示自动进行大规模图像生成、基于面部关键点的过滤与空间对齐,以及将模型中心倾向提炼为单张代表性肖像的中值像素合成。所得合成图无需统计学背景即可解读;观者一眼便能看出,当提示为'a doctor'与'felon'时模型'想象'的分别是谁。我们在Stable Diffusion XL上用40个社会与职业身份提示演示GLEaN,生成的合成图重现了已有记载的偏见,并揭示了肤色与预测情绪之间的新关联。在一项被试间用户研究(N = 291)中,我们发现GLEaN肖像传达偏见的效果与常规数据表相当,但所需观看时间显著更短。由于该方法仅依赖生成输出,它也可以在任何黑盒、闭权重的系统上复现,无需访问模型内部。GLEaN提供了一种可扩展、模型无关的偏见可解释性方法,专为公众理解而设计,已在https://github.com/cultureiolab/GLEaN公开。

GLEaN:一种面向公众理解的文生图偏见检测方法:论文配图
图1:GLEaN工作流程概览,并给出"business executive"提示下的示例输出,使文生图偏见检测易于公众理解。