论文

KnowBias:通过知识偏差神经元增强减轻大语言模型的社会偏见

KnowBias: Mitigating Social Bias in LLMs via Know-Bias Neuron Enhancement

模型推理解码与生成控制

摘要

大语言模型(LLM)表现出强化有害刻板印象的社会偏见,限制了其安全部署。多数现有去偏方法采用抑制式范式,修改与偏见行为相关的参数、提示或神经元;然而,这类方法往往脆弱、泛化弱、数据效率低,且容易损害通用能力。我们提出KnowBias,一个轻量且概念上不同的框架,通过增强而非抑制编码偏见知识的神经元来缓解偏见。KnowBias借助基于归因的分析,用少量偏见知识问题识别编码偏见知识的神经元,并在推理时有选择地增强它们。这一设计在保留通用能力的同时实现强去偏效果,跨偏见类型与人口群体泛化,且数据效率极高,只需少量简单的是/否问题,无需重训练。在多个基准和LLM上的实验表明,其去偏性能持续达到最先进水平,而效用损失极小。数据与代码见 https://github.com/JP-25/KnowBias。

知偏见而行更善:经Know-Bias神经元增强缓解LLM社会偏见
图1:大语言模型(LLM)表现出社会偏见,但同时也知晓这种偏见。我们的方法增强 LLM 中的 know-bias 神经元,以缓解社会偏见。