论文

GPT 模型中的危害洗钱:多代经过安全训练的模型中性别歧视不仅没有减少反而发生转变的证据

Harm Laundering in GPT Models: Evidence That Gender Discrimination Is Transformed Rather Than Reduced Across Safety-Trained Generations

模型评测鲁棒性、公平性与可信度评测

摘要

大型语言模型的安全评估依赖于表面形式分类器,该分类器报告模型各代中危害分数不断下降的情况。我们提供的证据表明,这种方法在系统上是不完整的:明确的歧视性内容被转化而不是被删除。我们称之为\emph{危害洗钱}。通过分析涵盖 GPT-2 到 GPT-5(OpenAI GPT 血统;三种人口统计条件)的 15 个模型中的 450,000 个性别导向的完成结果,我们发现,GPT-2 中女性主导的输出中普遍存在的性暴力集群在 GPT-4 中消失,而男性主导的完成行为获得了女性主导的完成行为所没有的积极代表性领域(照顾、情感范围、盟友身份)。这种模式在 GPT-5 中最为明显:Topic~5(1,997~文档)将乳腺癌视为男性权利辩论,而女性主导的输出中出现了零等值簇。三个独立的分类器将此内容评分为无毒。 GPT-4 情绪评分反转:早期模型贬低女性;后来的模型过度正确。在 GPT-4 对齐边界上,女性主导完成的主题多样性相对于男性下降了 36%(W/M~$= 0.58$,从 GPT-2 的 $0.91$ 开始)。注意代表性伤害差异与发布日期相关 ($ρ= +0.55$, $p = .034$),而 Detoxify 则不然 ($ρ= -0.23$, $p = .42$):毒性分数随着代表性伤害的增加而下降。我们将危害洗钱正式化为三标准测试,并提供适用于任何生成模型的三阶段检测协议。在 OpenAI GPT 谱系中,毒性评分的降低并不足以代表危害的降低。