论文
BiAxisBias:评估超越单个提示和单个解释的 LLM 偏差
BiAxisBias: Evaluating LLM Bias Beyond a Single Prompt and a Single Explanation
摘要
LLM 偏差分数可能取决于审核设计。我们引入了 BiAxisBias,这是一种预先指定的审计,可以改变任务、角色、观点、情绪和 200 多个刻板印象语句的措辞,同时保留强制选择和理由作为单独的协议读数。其主矩阵涵盖 8 个 LLM 和 401 个模板(641,600 个响应)。在 5 个同等问题中,1,600 个模型语句对中的 17.1% 更改了选择。两个臂中每个单元都有 3 个观察结果,所有 10 个三词子集的不稳定性平均为 10.5%,而三个相同的调用的不稳定性平均为 6.3%。在四种受控任务范式中,9/28 模型对相反;七模型因子敏感性将任务情感识别为最大的双向分量(原始 eta 平方 = 0.0465)。在 10,000 次等预算重抽样中,相对于声明的 18 条件有限参考的平均绝对误差对于单模板集中为 10.63 点,对于矩阵范围简单随机抽样为 1.86,对于条件分层为 1.75;排名倒挂分别为20.6%、4.8%和5.5%。因此,广泛的覆盖范围推动了收益,而分层仅具有适度的分数误差优势,并且与随机抽样相比没有排名优势。在单独的强制输出诊断中,7,959 个双重有效响应中有 34.2% 的任务特定选择映射和法官编码的基本原理立场不一致(按方向分别为 31.2% 和 3.0%)。这诊断的是输出契约的敏感性,而不是一个结构的两个经过验证的测量。