论文

基础模型中偏差缓解的表示级评估

A Representation-Level Assessment of Bias Mitigation in Foundation Models

模型评测鲁棒性、公平性与可信度评测

摘要

我们研究成功的偏差缓解如何重塑仅编码器和仅解码器基础模型的嵌入空间,通过表征分析提供模型行为的内部审计。使用 BERT 和 Llama2 作为代表性架构,我们通过比较模型的基线变体和偏差减轻变体来评估性别和职业术语之间关联的变化。我们的研究结果表明,减少偏见可以减少嵌入空间中的性别职业差异,从而产生更加中立和平衡的内部表征。这些表征变化在两种模型类型中都是一致的,这表明公平性的改进可以表现为可解释的几何变换。这些结果使嵌入分析成为理解和验证基础模型中去偏方法有效性的宝贵工具。为了进一步促进仅解码器模型的评估,我们引入了 WinoDec,这是一个由 4,000 个带有性别和职业术语的序列组成的数据集,并向公众发布。 (https://github.com/winodec/wino-dec)