论文
我们能否在 LLM 中找到并防止刻板印象?
Can We Locate and Prevent Stereotypes in LLMs?
摘要
大语言模型 (LLM) 中的刻板印象可能会延续有害的社会偏见。尽管模型被广泛使用,但人们对这些偏差在神经网络中的位置知之甚少。本研究调查了 GPT 2 Small 和 Llama 3.2 定位刻板印象相关激活的内部机制。我们探索了两种方法:识别编码刻板印象的个体对比神经元激活,以及检测对有偏差的输出有很大贡献的注意力头。我们的实验旨在绘制这些“偏见指纹”,并为减轻刻板印象提供初步见解。