论文

HoloFair:统一的 T2I 公平性评估和 Fair-GRPO 去偏

HoloFair: Unified T2I Fairness Evaluation and Fair-GRPO Debiasing

模型评测基准与评测资源

摘要

文本到图像(T2I)模型在视觉真实性和语义一致性方面取得了重大进展,但它们经常延续和放大社会偏见。现有的评估方法通常仅解决单维偏差,缺乏在社会相关的更深语义层面揭示模型偏差的视角。我们推出 HoloFair,一个用于多维人口统计偏差分析的综合基准框架。该框架基于我们的大规模公平导向数据集和 SpaFreq(空间频率)属性分类器,提出了多属性、分组偏差指数(MGBI)指标,旨在评估内在多样性和条件偏差。除了评估之外,我们还进一步引入了 Fair-GRPO,这是一种基于强化学习的去偏方法,通过设计的多目标奖励函数来改变生成模型的分布。例如,在 SD3.5-Medium 模型上的实验表明,Fair-GRPO 在保持高图像质量的同时显着提高了多维公平性。我们还分析了潜在的 奖励作弊 现象并提供相应的缓解策略。代码和数据集可在 https://github.com/1059684669/HoloFair 获取