论文
揭秘 LAION-5B:大规模图像数据集中的年龄、性别、种族和情感偏见
Unmasking LAION-5B: Age, Gender, Race, and Emotion Biases in Large-Scale Image Datasets
摘要
LAION-5B 等大规模图像文本数据集是现代人工智能系统的基础,但其庞大的规模和未经管理的性质引起了人们对人口统计和刻板印象偏见的严重担忧。本研究对 LAION-5B 数据集的两个主要组成部分 LAION-2B-en 和 LAION-2B-multi 的人口构成以及代表性、刻板印象和交叉偏差进行了全面分析。我们使用最先进的模型——FairFace、DeepFace 和 Emo-AffectNet——分析数据集中检测到的人脸,以识别年龄、性别、种族和表达情绪方面的偏见。我们的研究结果表明,在两个数据集组成部分中,年轻人(20--39 岁)、白人和男性的代表性明显过高,而少数族裔群体和中年或老年女性的代表性始终不足。我们还观察到人口特征和情绪之间的刻板关联,例如“愤怒”主要与男性相关,“幸福”主要与女性相关,这表明数据中存在系统性失衡。这些模式在两个人口统计模型和 LAION-5B 的两个组件中的一致性表明,这些偏差深深嵌入到最广泛使用的训练数据集之一中。考虑到 LAION-5B 用于训练生成模型的规模,这些人口统计不平衡可能会影响众多下游人工智能系统的行为和输出。