论文
LLM 的解毒:来自数据集本身
Detoxification for LLM: From Dataset Itself
摘要
现有的 大语言模型 解毒方法主要集中在 后训练 阶段或推理时间,而很少解决毒性来源,即数据集本身。这种基于训练或可控的解码方法无法完全抑制模型固有的毒性,而对预训练数据集进行去毒可以从根本上减少模型在训练过程中学习到的毒性。因此,我们尝试使用 SoCD(软对比解码)直接对原始语料库进行解毒,它指导 LLM 本地化和重写原始数据中的有毒跨度,同时保留语义,在我们提出的 HSPD(分层语义保留解毒)管道中,产生一个解毒语料库,可以直接替换 微调 或其他训练的原始语料库。在 GPT2-XL 上,HSPD 实现了最先进的解毒,将毒性概率 (TP) 从 0.42 降低至 0.18,将预期最大毒性 (EMT) 从 0.43 降低至 0.20。我们进一步验证了 LLaMA2-7B、OPT-6.7B 和 Falcon-7B 上一致的一流结果。这些发现表明,使用 HSPD 进行语义保留、语料库级重写可以有效抑制下游毒性,同时保留数据实用性并允许无缝源级缓解,从而降低后期模型行为调整的成本。 (代码可在:https://github.com/ntsw2001/data_detox_for_llm)