论文

BAFIS:评估现代文本到图像模型中的职业偏见和人类偏好的数据集+框架

BAFIS: Dataset + Framework to assess occupational Bias and Human Preference in modern Text-to-image Models

模型评测鲁棒性、公平性与可信度评测

摘要

生成式人工智能具有提高生产力和改变创意内容生产的潜力。然而,现有研究表明图像生成模型受到偏差的显着影响。这项工作研究了在与职业相关的图像生成的背景下文本到图像模型中存在的固有偏差和语言引起的偏差,用人类偏好反馈补充了既定的指标。我们对当前的五种文本到图像模型进行了综合评估:Midjourney v6.1、Stable Diffusion 3 Medium、DALL-E 3、Playground v2.5 和 FLUX.1-dev ,重点关注性别和种族偏见、图像质量和提示对齐。为了促进这一评估,我们开发了“公平图像合成战场”(BAFIS),这是一个旨在收集人类对生成图像偏差的反馈的平台。此外,我们创建了一个数据集,其中包含使用多语言提示生成的 21,140 张合成图像,作为我们分析的基础。通过将我们的结果与德国联邦就业局的官方统计数据进行比较,我们进一步将我们的结果置于更广泛的社会背景下。我们的研究结果揭示了文本到图像模型的系统偏差,已建立的评估指标与主观用户评分部分相关。因此,我们的研究强调需要考虑人类偏好,以开发更公平、更具包容性的文本到图像模型。