论文
谁来定义公平?生成式模型中人口群体表征的基于目标提示方法
Who Defines Fairness? Target-Based Prompting for Demographic Representation in Generative Models
摘要
Stable Diffusion和DALL-E等文生图(T2I)模型让生成式AI广泛普及,但近期研究揭示这些系统常常复制社会偏见,尤其体现在跨职业描绘人口群体时。“doctor”或“CEO”之类的提示常常生成肤色更浅的输出,而“janitor”等地位较低的角色则呈现更多多样性,从而强化刻板印象。现有缓解方法通常需要重新训练或精心整理的数据集,使大多数用户无法使用。我们提出一个轻量的推理时框架,通过提示层干预缓解表征偏见,无需修改底层模型。我们的方法不假定单一的公平定义,而是允许用户在多种公平规格中选择——从均匀分布这类简单选择,到由大语言模型(LLM)给出的引用来源并提供置信度估计的更复杂定义。这些分布按相应比例指导构建针对特定人口的提示变体,我们通过审计对声明目标的遵从程度并测量最终肤色分布来评估对齐,而不是将均匀性假定为“公平”。在覆盖30种职业和6个非职业场景的36个提示上,我们的方法使观察到的肤色结果朝与声明目标一致的方向偏移,并且当目标直接在肤色空间中定义时(回退方案),可降低与目标的偏差。这项工作展示了如何让公平干预在推理时变得透明、可控且可用,直接赋能生成式AI的用户。
