论文

IMPLICIT-Bench:在中性提示下测量文本到图像模型中的隐式偏差

IMPLICIT-Bench: Measuring Implicit Bias in Text-to-Image Models under Neutral Prompts

模型评测基准与评测资源

摘要

文本到图像 (T2I) 模型通常使用基于槽的模板(例如“[职业]照片”)来评估偏差。此类模板仅单独探测 \emph{explicit} 人口统计属性(例如性别、肤色)。他们忽视了自然提示中出现的更广泛的\emph{隐式}偏见:当未指定与刻板印象相关的属性时,模型仍然默认为刻板印象输出。我们引入了 IMPLICIT-Bench,这是在此类提示下测量 T2I 模型中隐性偏差的基准。关键设计是受控提示三元组的结构化知识图(KG)构造:中性、刻板印象和反刻板印象变体,仅在单个偏差维度上有所不同,同时保留场景语义。这使得模板基准无法实现的偏差效应的精确归因成为可能。 IMPLICIT-Bench 包含 11 个偏差类别的 5,493 个提示,并通过多模型一致性、基于 CLIP 的验证和人工评估进行验证。使用这个基准,我们表明最先进的 T2I 模型在中性提示下表现出系统偏差,这是一种现有评估基本上不可见的故障模式。然后,我们使用 IMPLICIT-Bench 来评估去偏差方法,揭示偏差减少和语义保真度之间的基本权衡。