论文

潜在指令表示对齐:防御 LLM 中的越狱、后门和不良知识

Latent Instruction Representation Alignment: defending against jailbreaks, backdoors and undesired knowledge in LLMs

模型训练模型编辑与遗忘

摘要

我们解决了 大语言模型 (LLM) 的越狱、后门和遗忘问题。与之前的工作不同,之前的工作根据给定恶意指令时的行为来训练 LLM,我们的方法专门训练模型以改变其解释指令的方式。我们的方法,潜在指令表示对齐(LIRA),极大地提高了泛化能力。我们通过内部对抗性训练算法进一步提高泛化能力。我们的方法可以阻止超过 99% 的 PEZ 越狱攻击;删除具有挑战性的不安全代码后门;并在 WMDP 网络上实现最佳遗忘,而良性能力的损失可以忽略不计。