论文
大模型交叉群体公平性:偏差、可靠性与提示策略
Intersectional Fairness in Large Language Models
摘要
大语言模型 (LLM) 越来越多地部署在社会敏感环境中,引发了对公平和偏见的担忧,特别是当多个敏感属性交叉时。我们使用来自问答偏差基准 (BBQ) 的两个数据集,将种族、性别和社会经济地位结合起来,系统地评估了 6 个 LLM 中的交叉公平性。我们评估跨背景和问题极性的偏见、子群体公平性、准确性和一致性。虽然模型在模糊的环境中表现良好,但稀疏的非未知预测限制了公平性评估。在消除歧义的上下文中,刻板印象对齐对不同数据集的准确性的影响不同:对于六个模型中的五个,模型有利于 Race-SES 中的刻板印象强化项目,但在 Race-Gender 中反刻板印象项目。尽管在某些情况下观察到的差异较低,但子组公平性指标揭示了结果分布不均匀,而重复运行显示了回答一致性的变化。总体而言,没有一个模型能够始终如一地实现公平性和可靠性,这凸显了评估跨交叉背景的偏见、子群体公平性和一致性的必要性。