论文

分数结束时的偏差

Bias at the End of the Score

模型评测鲁棒性、公平性与可信度评测

摘要

奖励模型 (RM) 本质上是非中性价值函数,设计和训练用于编码特定目标,例如人类偏好或文本图像对齐。 RM 已成为文本到图像 (T2I) 生成系统的重要组成部分,它们在数据集过滤的各个阶段使用,作为评估指标,作为参数优化期间的监督信号,以及用于 T2I 输出的生成后安全和质量过滤。虽然已经研究了 RM 集成到 T2I 管道中的具体问题(例如 奖励作弊 或模式崩溃),但它们作为评分函数的鲁棒性和公平性仍然很大程度上未知。我们在 T2I 模型训练 和生成期间针对人口统计偏差对 RM 稳健性进行了大规模审核。我们提供的定量和定性证据表明,虽然最初是作为质量衡量标准而开发的,但 RM 编码了人口统计偏差,这会导致奖励引导的优化,使女性图像主题不成比例地性感化,从而强化性别/种族刻板印象,并破坏人口多样性。这些发现凸显了当前奖励模型的缺点,挑战了其作为质量指标的可靠性,并强调需要改进数据收集和训练程序以实现更稳健的评分。