论文

当噪声制造偏差时:噪声文本下 LLM 作为法官偏差测量的脆弱性

When Noise Fabricates Bias: The Fragility of LLM-as-a-Judge Bias Measurement under Noisy Text

模型评测鲁棒性、公平性与可信度评测

摘要

大语言模型 越来越多地被用作评判者来衡量文本中的社会偏见,但他们评判的段落往往很嘈杂,包含拼写错误、非正式拼写和损坏的标点符号。这种表面噪音对社会偏见测量的影响仍不清楚。为了研究这个问题,我们将五个不同强度级别的真实噪声条件应用于 3,822 个刻板印象相关的响应,并将所得的偏差判断与原始文本的偏差判断进行比较。我们发现,这种表面噪声不会对称地降低偏差测量:将中性判断转变为有偏见的判断的可能性比将有偏见的判断转变为中性判断的可能性高得多,幅度高达 120 倍。我们进一步观察到四位 LLM 法官的两个不明显的影响:在最脆弱的法官中,失真在温和、现实的噪声水平下是最纯粹的,其中擦除是最稀有的,并且随着法官变得强大,它会朝着平价而不是逆转的方向衰减。因此,对噪声文本测量的偏差被系统性地高估,大多数是在对公平性最重要的类别中。