论文
自除偏:去偏自校正 大语言模型
Self-Debias: Self-correcting for Debiasing Large Language Models
摘要
尽管大语言模型(LLM)表现出卓越的推理能力,但固有的社会偏见往往会在整个思想链(CoT)过程中级联,导致持续的“偏见传播”。现有的去偏方法主要关注静态约束或外部干预,一旦触发就无法识别和中断这种传播。为了解决这一限制,我们引入了 Self-Debias,这是一个旨在灌输内在自我纠正能力的渐进框架。具体来说,我们将去偏过程重新表述为战略资源重新分配问题,将模型的输出概率质量视为有限资源,从有偏启发法重新分配到无偏推理路径。与应用广泛惩罚的标准偏好优化不同,自我去偏采用受动态去偏约束的细粒度轨迹级目标。这使得模型能够有选择地修改有偏见的推理后缀,同时保留有效的上下文前缀。此外,我们还集成了利用一致性过滤的在线自我改进机制来自动合成监督信号。只需 20k 个带注释的样本,Self-Debias 就能激活高效的自我校正,实现卓越的去偏性能,同时保留一般推理能力,而无需持续的外部监督。