论文
偏差审计检测到偏差,但在排名上存在分歧:来自十种工具和十种前沿模型的证据
Bias Audits Detect Bias but Disagree on Ranking: Evidence from Ten Instruments and Ten Frontier Models
摘要
新兴的人工智能监管要求对高风险系统进行偏见审计,审计分数开始用于对模型进行排名。两种用途都假设不同的审计工具可以很好地衡量同一事物以进行比较。我们直接测试这一假设,通过一个汇集的推理网关,在由十个前沿模型组成的共享面板上运行十种外在审计工具,首先针对职业性别偏见,然后针对年龄和社会经济地位。检测成功,排名失败。十个工具中有八个检测置信区间为零的偏差;两个广泛引用的直接探测基准已经饱和,因为前沿模型现在给出了中立的答案。但跨工具排名一致性与偶然性无法区分(Kendall 的 W=0.07,p=0.83)。使用六个故意较弱的模型进行正控制,可以区分两种解释:一旦面板跨越真正的能力差距,工具内可靠性就会恢复,但跨工具排名永远不会恢复,这表明工具测量不同的结构,而不是嘈杂地测量一种结构。甚至偏见的方向也因审计格式而异:强制选择决策工具大多过于正确(在 278 项招聘决策中,有 273 项针对女性和工薪阶层候选人),而自由生成和默认共指则保持刻板印象一致。这种模式在社会经济地位上也有体现;根据该论文自己的工具包含规则,关于年龄的明显排名协议消失了。实际信息:单一审计可以检测偏差并估计其在其自身运作中的方向,但没有单一审计支持将一种模型与另一种模型进行排名。所有原始响应、代码以及从源重新计算每个报告数字的分析均可在 https://github.com/williamguey/bias-audit-agreement 上获取。