论文

通过专家隔离和关闭大语言模型来遏制后门

Backdoor Containment via Expert Quarantine and Shutdown in LLMs

模型评测模型架构MoE安全与风险评测

摘要

后门大语言模型 (LLM) 可以在良性输入上正常运行,同时在隐藏触发器下生成攻击者指定的输出。现有的防御跨越四个阶段——训练前、训练中、后训练和推理时间——并共享两种基本策略之一:要么抑制后门学习(通过过滤有毒数据或在优化过程中中断其获取),要么学习,然后净化(通过修复模型权重或在完全后门模型形成后对输入进行门控)。我们提出了第三种策略,学习但通道:允许在训练期间形成后门,但将其路由到可以在部署时禁用的指定隔离组件。为此,我们提出了隔离专家关闭 QES,这是一种在正则化引导的类似 MoE 的设置中构建的计算高效的遏制策略。具体来说,在给定中毒数据集的情况下,QES 通过路由特定于专家的 LoRA 分支和轻量级路由器来增强基于 Transformer 的语言模型,并使用辅助路由目标将触发条件行为吸引到指定专家中,同时在其他地方保留良性能力。在部署时,缓解措施减少为单个恒定时间操作:将隔离专家的路由权重归零,无需触发筛选或进一步更新模型权重。根据经验,我们的方法在两个任务、三种攻击和四个模型系列的大多数设置上将攻击成功率 ASR 从 100% 降低到 0-10%,而下游效用通常保留或仅受到轻微影响。这些结果确立了学习但通道作为生成大语言模型中先前未探索的后门遏制机制。