论文
RPAM:用于评估下游输出中具有高预测有效性的语言模型中的关联的原则指标
RPAM: A Principled Metric for Evaluating Associations in Language Models with High Predictive Validity in Downstream Outputs
摘要
语言模型 (LM) 表现出有问题的偏见,例如刻板印象。有效分析和减轻此类偏差需要对潜在关联进行准确且可概括的评估方法。一些现有方法侧重于分析生成文本中的关联的下游指标。由于生成的文本内容在语言模型中可能会有很大差异,因此此类指标通常需要专门的评估数据集,这限制了此类下游指标的泛化。相比之下,上游指标在嵌入或连续概率的基本层面上检查 LM,从而能够跨 LM 进行有原则的关联分析。然而,迄今为止,生成 LM 的上游指标还没有发现与现实世界关联的紧密关系,包括在生成文本中测量的关联。为了解决这一差距,我们引入了相对概率关联度量(RPAM),这是一种用于生成 LM 的关联评估度量。对于不同质量的语言生成和目的的三个 LM(Mistral-7B-Instruct、Mistral-7B 和 GPT-2)和经过充分研究的评估数据集(WEAT-WS、Bellezza、WS-353 和 SST2),我们发现上游 RPAM 测量值与在人类中观察到的相应隐式和显式关联之间存在很强的关系,以及下游使用 LM 特定任务测量的偏差,在适用的情况下优于先前的记录值。