保真度偏好,而不是人口偏好:图像审美/偏好评分者的像素级属性敏感性审核
Fidelity Preference, Not Demographic Preference: A Pixel-Level Attribute-Sensitivity Audit of Image Aesthetic/Preference Scorers
摘要
文本到图像系统使用学习到的美学评分器来过滤训练数据并指导生成,但这些分数是否将人口统计属性编码为客观质量尚不清楚。我们使用合成图像和真实图像中肤色和体型的像素级干预来审核四个评分器(LAION-Aesthetics、PickScore、ImageReward、HPSv2)。我们的主要发现是,沿着皮肤亮度,主要影响是保真度偏好:未改变的图像得分最高,并且任一方向的扰动都会受到惩罚(倒U)。安慰剂臂显示这种惩罚不是皮肤算子的人为因素,因为将相同的 CIELAB L* 偏移应用于非皮肤区域会产生类似的惩罚幅度。然而,惩罚取决于操作员,并且仅适用于 LAION-Aes 的所有操作员。至关重要的是,仅对合成图像进行审核会产生误导:LAION-Aes 对合成面孔上的深色皮肤表现出强烈的偏好,但在 1470 个真实面孔上,这种偏好相反并变得小得多,并且放大变得不显着。在记分器之间,综合结果不会转移——对于 LAION-Aes 和 HPSv2 来说是相反的,对于 PickScore 来说是衰减的。我们提供了一个具有伪影控制和合成/真实交叉验证的可重复基准,以及像素级因果隔离的可审核性标准(适用于肤色,不适用于由于变形而导致的体型)。群体分层分析显示,除 HPSv2 之外,FDR 校正后各组之间的保真度惩罚不对称性并不稳健。我们的研究结果表明,天真的综合审计错误地判断了偏差的方向和幅度,并且只有对真实数据进行图像内因果隔离才能区分真正的人口统计偏差和保真度偏好。