论文
ImplicitBBQ:通过基于特征的提示对 大语言模型 中的隐式偏差进行基准测试
ImplicitBBQ: Benchmarking Implicit Bias in Large Language Models through Characteristic Based Cues
摘要
当明确表述人口统计身份时,大语言模型 会越来越多地抑制有偏见的输出,但当间接传达身份时,仍然可能表现出隐性偏见。现有的基准使用基于姓名的代理来检测隐性偏见,这些偏见与许多社会人口统计数据的关联较弱,并且无法扩展到年龄或社会经济地位等维度。我们引入了 ImplicitBBQ,这是一个 QA 基准,它通过基于特征的线索、隐含信号的人口统计相关属性、跨年龄、性别、地区、宗教、种姓和社会经济地位来评估隐性偏见。通过评估 11 个模型,我们发现模糊上下文中的隐性偏差比开放权重模型中的显性偏差高六倍多。值得注意的是,这种偏见在人口统计数据中分布不均:种姓最为严重,而性别受到的影响最小。安全提示和思维链推理未能从根本上缩小这一差距;即使是几次提示,虽然可以将隐性偏见减少 79%,但种姓偏见的水平却是任何其他维度的四倍。这些发现表明,当前的调整和激励策略解决了偏见评估的表面问题,但人口统计学相关的刻板印象很大程度上尚未得到解决。我们公开发布我们的代码和数据集,供模型提供商和研究人员对潜在的缓解技术进行基准测试。