论文
语言模型认为谁有能力?职业偏见的机制分析
Who Do Language Models Think Is Competent? A Mechanistic Analysis of Occupational Bias
摘要
语言模型(LM)通常会通过行为偏差评估,但目前尚不清楚它们是否不再代表引起偏差的潜在关联,或者只是学会了不表达偏差。在这项研究中,我们表明,即使行为偏差不明显,代表性偏差也常常是可检测到的。我们引入了一个因果框架,将职业偏见分解为两个测量点:模型对用户能力的内部表示及其可观察的输出。我们推导出用于表示用户专业知识的引导向量,并验证它们是否在问答任务和招聘任务中因果关系地调节模型行为。将该框架应用于几个开放权重模型,我们发现人口统计属性(例如性别、种族和社会经济地位)会影响模型对用户专业知识的表示,即使在行为指标检测到人口统计之间没有差异的情况下也是如此。我们表明,这些模型表示可以影响干预下的下游行为,表明仅行为指标可能无法检测到的故障模式。