论文

谁来定义公平?生成式模型中人口群体表征的基于目标提示方法

Who Defines Fairness? Target-Based Prompting for Demographic Representation in Generative Models

上下文与知识上下文工程

摘要

Stable Diffusion和DALL-E等文生图(T2I)模型让生成式AI广泛普及,但近期研究揭示这些系统常常复制社会偏见,尤其体现在跨职业描绘人口群体时。“doctor”或“CEO”之类的提示常常生成肤色更浅的输出,而“janitor”等地位较低的角色则呈现更多多样性,从而强化刻板印象。现有缓解方法通常需要重新训练或精心整理的数据集,使大多数用户无法使用。我们提出一个轻量的推理时框架,通过提示层干预缓解表征偏见,无需修改底层模型。我们的方法不假定单一的公平定义,而是允许用户在多种公平规格中选择——从均匀分布这类简单选择,到由大语言模型(LLM)给出的引用来源并提供置信度估计的更复杂定义。这些分布按相应比例指导构建针对特定人口的提示变体,我们通过审计对声明目标的遵从程度并测量最终肤色分布来评估对齐,而不是将均匀性假定为“公平”。在覆盖30种职业和6个非职业场景的36个提示上,我们的方法使观察到的肤色结果朝与声明目标一致的方向偏移,并且当目标直接在肤色空间中定义时(回退方案),可降低与目标的偏差。这项工作展示了如何让公平干预在推理时变得透明、可控且可用,直接赋能生成式AI的用户。

谁来定义公平?生成式模型中人口群体表征的基于目标提示方法:论文配图
图 1.我们的人口统计感知图像生成系统的视觉管道。给定输入提示(例如,“医生的全彩头像”),代理会提取相关概念并在 LLM 中查询用户指定范围内的人口统计目标分布。LLM返回人口比例以及置信度和引用的来源,这些信息都会被记录下来以供透明度和审计。然后使用目标分布生成子组提示变体,对这些变体进行采样以使用固定的文本到图像扩散模型生成目标条件图像集。当统计数据不可用或可信度较低时,管道会回退到预定义的目标(默认情况下统一 Fitzpatrick)。