论文

Acmite:通过概念引导的互信息减轻大语言模型中的性别偏见

Acmite: Mitigating Gender Bias in LLMs through Concept-Guided Mutual Information

模型训练参数高效训练

摘要

大语言模型(LLM)可以从训练数据中重现社会刻板印象,从而激发了对模型去偏差的广泛研究。然而,现有的方法通常依赖于明确的有偏见的例子或预定义的组术语替换,这使得它们对措辞敏感,并且在捕获跨不同上下文共享的刻板印象概念方面效果较差。更重要的是,它们通常会抑制有偏差的输出,而不会明确建模模型输出和潜在刻板印象概念之间的统计依赖性。我们提出了 Acmite,一个轻量级的概念引导框架,用于有针对性和选择性的去偏。 Acmite 将刻板印象表示为结构化语义概念,并使用最大边缘相关性 (MMR) 来选择不同的概念进行消除偏差。受互信息最小化的启发,它用 token 级 KL 散度来近似这种依赖关系,同时保留任务语义。仅当输入与刻板印象相关概念足够相似时,轻量级 LoRA 适配器才会在基本模型冻结的情况下进行训练,并在推理时激活;否则,直接使用原始模型。我们在 BBQ、CrowS-Pairs 和 StereoSet 上评估 Acmite,并在 ARC-Challenge、GSM8K 和 PIQA 上评估一般能力保留。三个大语言模型的实验表明,Acmite 有效地减轻了互补评估格式中的性别偏见,同时保持了在与偏见无关的任务上的竞争表现。匿名代码和数据可在 https://anonymous.4open.science/r/Acmite-18E2/. 获取