T2I-BiasBench:用于审核文本到图像模型中人口统计和文化偏见的多指标框架
T2I-BiasBench: A Multi-Metric Framework for Auditing Demographic and Cultural Bias in Text-to-Image Models
摘要
文本到图像(T2I)生成模型实现了令人印象深刻的视觉保真度,但继承并放大了训练数据中嵌入的人口不平衡和文化偏见。我们引入了 T2I-BiasBench,这是一个由 13 个互补指标组成的统一评估框架,可共同捕获扩散模型中的人口偏差、元素遗漏和文化崩溃——第一个同时解决所有三个维度的框架。我们以 Gemini 2.5 Flash(RLHF 对齐)作为参考基线,评估了三种开源模型 - Stable Diffusion v1.5、BK-SDM Base 和 Koala Lightning。该基准测试包含 1,574 个生成的图像,涵盖五个结构化提示类别。 T2I-BiasBench 集成了六项既定指标和七项附加指标:四项新提出的指标(综合偏差分数、可定位元素缺失率、隐式元素缺失率、文化准确率)和三项经过调整的指标(幻觉分数、Vendi 分数、CLIP 代理分数)。出现了三个关键发现:(1) Stable Diffusion v1.5 和 BK-SDM 在美容相关提示中表现出偏差放大 (>1.0); (2) 手术个人防护装备等背景限制大大减弱了职业角色的性别偏见(SD v1.5 的 CBS 博士 = 0.06); (3) 所有模型,包括 RLHF 对齐的双子座,都崩溃为一组狭窄的文化表征(CAS:0.54-1.00),证实对齐技术不能解决文化覆盖差距。 T2I-BiasBench 公开发布,支持生成模型的标准化、细粒度偏差评估。项目页面位于:https://gyanendrachaubey.github.io/T2I-BiasBench/