论文

公平修剪:通过差异激活定位 GLU-MLP 层中的人口统计偏差

Fairness Pruning: Locating Demographic Bias in GLU-MLP Layers via Differential Activations

模型评测模型行为与机制分析

摘要

这项工作提出了公平修剪,这是一种轻量级的结构干预方法,旨在管理和未来缓解 大语言模型 (LLM) 中的人口偏差。作为该方法的基础实证验证,这项工作重点关注因果偏差定位。该方法使用最小对比提示对和推理时间激活捕获,识别在 GLU 架构中处理人口统计属性时反应不同的神经元,评估 down_proj 输入处的信号。对多达 30 亿个参数的模型(Llama-3.2 系列和 Salamandra-2B)进行了实证评估,将标准化基准评估与定性文本生成实验相结合。结果表明,将已识别的神经元归零会改变模型对相关人口统计变量的响应方式。然而,干预不会产生平坦的缓解,而是会导致双向偏差不稳定:因为 BiasScore 是无符号的,候选集混合了推动和反对刻板印象的神经元,并且对总偏差的净效应取决于哪个符号占主导地位。这种干预是极其外科手术式的:将 Llama-3.2-1B 中最多 40 个神经元(小于总 MLP 宽度的 0.031%)归零,可以实现推理和一般知识能力的平均保留率为 99.49%。这些发现从经验上证实了人口统计偏差处理和模型能力在可分离电路上运行,为从盲目归零过渡到定向行为调节奠定了方法论基础。