隐形影响:通过 大语言模型 中的角色工程调查隐式交叉偏差
Invisible Influences: Investigating Implicit Intersectional Biases through Persona Engineering in Large Language Models
摘要
大语言模型 (LLM) 擅长生成类似人类的语言,但经常嵌入和放大隐性的交叉偏见,尤其是在角色驱动的环境下。现有的偏差审计依赖于静态的、基于嵌入的测试(CEAT、I-WEAT、I-SEAT)来量化绝对关联强度。我们表明,当模型采用社会角色时,它们在捕捉动态变化方面存在局限性。我们通过引入偏差放大差异和可解释性分数(BADx)来解决这一差距:一种新颖的、可扩展的指标,用于测量角色引起的偏差放大并整合本地可解释性见解。 BADx 包含三个组成部分 - 差异偏差分数(BAD,基于 CEAT、I-WEAT、I-SEAT)、角色敏感性指数 (PSI) 和波动性(标准偏差),并通过基于 LIME 的分析进行增强,以强调可解释性。这项研究分为两项不同的任务。任务 1 建立静态偏差基线,任务 2 应用六个角色框架(边缘化和结构优势)来衡量 BADx、PSI 和波动性。这是针对五个最先进的 LLM(GPT-4o、DeepSeek-R1、LLaMA-4、Claude 4.0 Sonnet 和 Gemma-3n E4B)进行的研究。结果显示角色背景显着调节偏见。 GPT-4o表现出高灵敏度和挥发性; DeepSeek-R1 抑制偏差,但波动性不稳定; LLaMA-4 保持低波动性和稳定的偏差曲线,且放大有限; Claude 4.0 Sonnet实现平衡调制; Gemma-3n E4B 在适度放大的情况下达到最低的波动性。 BADx 通过揭示静态方法中忽视的上下文相关偏差,比静态方法表现得更好。我们的统一方法提供了一种系统方法来检测五个流行的 LLM 中的动态隐式交叉偏差。