论文

等等,我公平吗?表征演绎刻板印象并通过 Fair-GCG 缓解它

Wait, am I Being Fair? Characterizing Deductive Stereotyping and Mitigating It with Fair-GCG

模型评测鲁棒性、公平性与可信度评测

摘要

警告:本文包含一些有毒和冒犯性的言论。虽然推理在最近的 大语言模型 (LLM) 中总体上提高了公平性,但失败仍然存在。在这项工作中,我们确定了一种失败模式,即演绎刻板印象,其中模型将人口水平的统计规律应用于个别案例,产生逻辑上连贯但存在社会偏见的推论。我们对这种现象提供了统计解释。为了引导模型进行公平感知推理,我们提出了一个推理时间注入框架。我们进一步引入 Fair-GCG 来系统地发现有效的注入短语。 Fair-GCG 发现的注入短语提高了多个公平基准的性能,从小到大的 LLM 泛化,提高推理级别的公平性,减少开放式生成中的偏差,并转移到现实世界的公平敏感任务。