论文

面向LLM安全的同策略蒸馏:模板鲁棒重对齐的路由方法

On-Policy Distillation for LLM Safety: A Routing Approach to Template-Robust Realignment

模型训练模型编辑与遗忘

摘要

微调是使大语言模型(LLM)专用化的主流范式,但它暴露出一个关键漏洞:恶意数据提供者可以将有害行为嵌入下游语料,造出保留专业技能却可按需违背人类价值观的模型。现有的安全重对齐防御在实践中常常失效,原因在于三个关键局限:它们经常导致专业技能的灾难性遗忘;当防御方无法观察攻击者的提示模板时,其有效性即告崩溃;且成功重对齐的模型仍易通过简单的系统提示切换被再次越狱。为应对这些挑战,我们提出基于路由的同策略蒸馏(Routing-based On-Policy Distillation,ROPD),一个新颖的重对齐框架,它对对齐与受损输出概率分布之间的散度进行建模,而不是拟合特定提示模板。我们开展了大量实验,在三个数据集和三个对齐强度各异的基座模型上,将ROPD与四个最先进基线进行比较。我们的结果表明,当基线防御面临模板不匹配时,往往伴随着下游任务性能的严重退化。相比之下,ROPD显著缓解模板不匹配风险,在防御有效性和能力保持两方面均保持更优的鲁棒性。尽管我们的分析表明ROPD并非对模板变化完全免疫,但其性能退化相比现有方法可以忽略不计,为鲁棒的LLM重对齐确立了新标准。

面向LLM安全的在策略蒸馏:模板鲁棒重对齐的路由方法:论文配图
图 2:ROPD 管道概述:两名冻结教师 - 对齐的原始模型(拒绝优先)和微调模型(任务技能) - 将源路由的顶级 KK KL 蒸馏提供给单个重新对齐的学生。