论文

CausalDetox:语言模型解毒的因果头选择和干预

CausalDetox: Causal Head Selection and Intervention for Language Model Detoxification

模型训练模型编辑与遗忘

摘要

大语言模型 (LLM) 经常产生有毒内容,给安全部署带来重大风险。当前的缓解策略通常会降低生成质量或需要昂贵的人工注释。我们提出了 CAUSLDETOX,一个框架,用于识别和干预导致有毒物质产生的特定注意头。使用必要性和充足性概率 (PNS),我们分离出对于毒性而言必要且充分的最小头部集合。我们通过两种互补策略来利用这些组件:(1) 局部推理时间干预,它构建动态的、特定于输入的引导向量以实现上下文感知解毒,以及 (2) PNS 引导的 微调,它永久忘却有毒表征。我们还引入了 PARATOX,这是一种对齐有毒/无毒句子对的新颖基准,可以进行受控的反事实评估。 ToxiGen、ImplicitHate 和 ParaDetox 上的实验表明,与基线相比,CAUSLDETOX 的毒性降低幅度高达 5.34%,同时保持语言流畅性,并且头部选择速度提高了 7 倍。