论文

标记,不要擦除:LLM 中双用知识的词元接种

Mark, Don't Erase: Token Inoculation for Dual-Use Knowledge in LLMs

模型训练模型编辑与遗忘

摘要

对双重用途知识的安全干预通常会选择销毁危险内容(例如忘记、过滤)和在输出层抑制危险内容(例如拒绝训练);两者都在相邻领域的能力或过度拒绝方面缴纳税款。我们认为正确的操作是调节,而不是减少:我们证明危险知识可以保留在模型中,并通过特权控制词元进行行为门控。我们的方法“词元接种”引入了绑定和分支方法。首先,在继续 预训练 期间,我们通过在双重用途文档旁边插入特殊标记来标记危险内容,因此模型将标记绑定到危险域的底层语义。其次,在监督 微调 期间,我们教导模型在特殊词元存在时正确回答危险查询,并在特殊词元不存在时拒绝它们,从而在不消除双重用途知识的情况下实现选择性拒绝。在危险领域(例如 WMDP-Bio),词元接种将准确度从 79% 降低到 18%,同时保留基础模型良性领域性能(例如 MMLU)的 93%,从而在 1B-14B 模型规模上实现针对遗忘和拒绝调整基线的最佳安全性与效用权衡。我们进一步表明,拒绝选择性是可以通过条件信号的质量来控制的,并且 预训练 期间的特定领域语义绑定对于条件行为泛化到记忆触发之外至关重要。我们的结果表明,安全一致性更适合作为一种条件问题,而不是遗忘问题:当敏感知识在受控访问下保留时,行为控制比被破坏时更精确。