论文
中性提示,非中性人群:量化Gemini Flash 2.5 Image与GPT Image 1.5中的性别与肤色偏见
Neutral Prompts, Non-Neutral People: Quantifying Gender and Skin-Tone Bias in Gemini Flash 2.5 Image and GPT Image 1.5
摘要
本研究量化了两个广泛部署的商业图像生成器——Gemini Flash 2.5 Image(NanoBanana)和GPT Image 1.5——中的性别与肤色偏见,以检验中性提示会产生人口学上中性输出这一假设。我们使用四个语义中性的提示生成了3,200张照片级真实感图像。分析采用一条严格的流水线,结合混合颜色归一化、面部关键点遮蔽,以及使用Monk(MST)、PERLA和Fitzpatrick量表的感知均匀肤色量化。中性提示产生了高度极化的默认输出。两个模型都表现出强烈的“默认白人”偏见(超过96%的输出)。然而,二者在性别上尖锐分化:Gemini偏向呈现为女性的人物,而GPT偏向肤色较浅的呈现为男性的人物。本研究以光照感知比色方法对最先进模型进行了大规模比较审计,在合成图像中区分美学呈现与底层色素沉着。研究表明,中性提示的功能是诊断探针而非中性指令。它为审计算法视觉文化提供了一个稳健框架,并挑战了无标记语言会带来包容性表征这一社会语言学假设。
