论文
一致性辩证法:利用不安全知识进行动态安全路由
Dialectics of Alignment: Harnessing Unsafe Knowledge for Dynamic Safety Routing
摘要
大语言模型(LLM)对齐中的主流范例通过擦除、过滤不安全数据或训练模型来严格拒绝有害提示。虽然可以有效地减少直接毒性,但这种方法从根本上限制了模型的认识论范围,导致系统过于谨慎,对敏感但良性的查询输出无信息的全面拒绝。在这项工作中,我们挑战了必须丢弃不安全数据的正统观念。我们提出了一种辩证的对齐方法,假设不安全的数据编码丰富的、特定领域的知识,这对于细致、安全和信息生成至关重要。为了实现这一点,我们引入了 SafeMoE,这是一种专家混合 (MoE) 框架,它将不安全的知识隔离到专门针对有害语料库进行训练的特定领域的低秩适配器(LoRA 专家)中。为了综合这些不安全原语的安全性,我们使用最少的、高度策划的安全信息响应集来训练轻量级门控网络。在推理过程中,该路由器动态协调不安全的专家,有效地引导生成轨迹以利用他们的深层领域知识,同时严格执行安全约束。跨严格安全基准的广泛实证评估表明,SafeMoE 不仅更安全,安全响应率相对提高了 20% 以上(绝对增益超过 15%),而且在安全性和危害性受到首要关注时,还能产生更多信息丰富的响应。此外,该路由机制对未见过的域和更广泛的安全任务表现出强大的零样本泛化能力,而无需特定于域的监督。我们的研究结果表明了一种范式转变:真正的安全不需要掩盖不安全的知识,而是需要对其进行受控整合。