论文

通过认知权利评估 LLM 的二阶偏差

Evaluating Second-Order Bias of LLMs Through Epistemic Entitlement

模型评测鲁棒性、公平性与可信度评测

摘要

LLM 中对社会偏见的评估主要集中在模型是否生成或暗示有偏见的内容。然而,随着 LLM 越来越多地被用作偏见的判断者,他们在评估有偏见的内容时可能会以更微妙的方式表现出社会偏见,而当前的方法无法系统地捕获这些偏见。我们将其称为二阶偏见:LLM 对社会偏见的判断中的社会偏见,我们通过新颖的、基于哲学的推理任务对其进行评估。借鉴权利认识论,我们将偏见概念化为塑造认知主体的理性探究的错位基础知识,并为 LLM 导出逻辑推理任务,以判断有偏见的文本对谁来说是可接受或不可接受的。我们开发了两个简单的指标来衡量 LLM 法官在没有足够支持的情况下推断人口统计可接受性时的偏见程度,以及这些推断在有偏见的文本针对的群体之间有何不同。评估开放和封闭模型,我们发现我们的任务通过在模型判断中暴露偏差来逃避安全护栏。它在不同的目标群体之间系统地变化,反映了隐含的社会地图,并显示了模型如何仍然由人口统计标签触发。我们的工作表明需要在判断任务中进行 LLM 偏差评估,更广泛地说,需要更有理论依据的 NLP 偏差评估方法。我们在 https://github.com/uofthcdslab/second-order-bias 发布了我们的代码和模型响应。