论文

毒性存在于哪里?语言模型中的机械定位和定向抑制

Where Does Toxicity Live? Mechanistic Localization and Targeted Suppression in Language Models

模型训练模型编辑与遗忘

摘要

大语言模型 经常生成有毒、仇恨或有害内容,但现有的缓解方法依赖于昂贵的再培训或输出级过滤,无法从机制上洞察毒性的内部根源。我们引入了 Meow2X 和 TRNE,这是两个互补的免再训练框架,通过分析有毒提示和中性提示之间的激活差异,将毒性定位到特定层和神经元,然后通过推理时间缩放或最小一级权重编辑来抑制它们——无需任何梯度下降。使用双安全评估器对五个 LM、两个基准和 90 个配置进行的评估表明,在保持语言建模质量的同时,毒性持续降低。我们的分析表明,毒性在早期 MLP 层中被不成比例地编码,不同架构之间存在差异,并且被单评估器设置系统性地低估——强调了多评估器安全评估的必要性。通过将机械可解释性与实际解毒联系起来,我们的框架提供了一条通向更安全、更透明的语言模型的原则性道路。