论文

缺失的最小对:改进 LLM 刻板印象评测

The Missing Minimal Pair: Stereotype Evaluation in LLMs

模型评测鲁棒性、公平性与可信度评测

摘要

在大语言模型中测量偏差的常见方法是比较两个对比刻板印象句子的对数似然。我们认为,这种单对比较通常是不可靠的:简单地用替代属性重写相同的刻板印象可能会产生逻辑上不一致的偏好。为了解决这个问题,我们提出了一种双最小对设置,引入两个比较轴以进行稳健的刻板印象评估。首先,我们提出了一个数据增强框架,通过生成释义和替代属性来填补现有刻板印象数据集中的关键空白。我们将我们的框架应用于一组英语、俄语、西班牙语和汉语刻板印象。其次,我们引入了两个针对对偶最小对设置量身定制的评估指标。其中一个指标通过对社会群体和刻板属性之间的互信息(MI)进行建模,提供了关于偏见的新视角。这种基于 MI 的指标更适合聚合,并且可以对不同语言和模型之间的刻板印象强度进行更稳健的比较。我们的代码可在 https://github.com/stepanat/missing-minimal-pair/. 获取

缺失的最小对:改进 LLM 刻板印象评测:论文原图
图 2:我们的数据增强框架。最初的一组刻板印象通过释义得到增强,并使用 LLM 进行替换。自动化质量保证和人工验证可确保最终的原型集是高质量的。