论文

审计做出裁决:LLM 决策审计中的工具影响竞争对手人口统计偏见

The Audit Decides the Verdict: Instrument Effects Rival Demographic Bias in LLM Decision Audits

模型评测鲁棒性、公平性与可信度评测

摘要

语言模型是否看起来存在人口统计学偏见可能取决于审计如何提出问题。一项慈善援助基准报告称,当一次要求评级时,相同的模型有利于少数族裔申请人,而当并列排名时,则会惩罚一些少数族裔申请人。我们测试了这种逆转是否普遍适用于招聘、贷款和医疗分流:对五种型号提出了 40,726 个请求,申请仅在申请人姓名上有所不同,并且在收集之前修复了主要测试。事实并非如此。 36 个计划对比没有一个能够通过修正。评级优势将其符号保持在公布大小的大约一半,并且精确扩展将任何招聘排名惩罚限制在公布的效果以下,尽管贷款和分类排名下限高于该边际,因此排除仅对招聘排名和所有三个领域的评级是决定性的。跟踪其注入尺寸的植入差异和原始援助材料上的定向复制限制了这些零值。审计比人口统计更活跃:模型几乎总是承认透明的审计,将每个相同内容的比较联系起来,无论不同的细节是种族还是爱好,并奖励第一名的候选人与我们衡量的任何人口统计影响一样多。审计结论更多地反映了审计建设,而不是人口偏见。