论文
同策略安全蒸馏会引入后门风险吗?
Does On-Policy Distillation for Safety Pose Backdoor Risks?
摘要
同策略蒸馏 (OPD) 作为将功能从 教师模型转移到 学生模型的有效方法而受到越来越多的关注。最近的研究进一步探索 OPD 作为提高大语言模型安全性的工具,并取得了有希望的结果。然而,这些方法通常假设 教师模型 和训练数据是可信的。在本文中,我们发现了 OPD 的一个被忽视的安全威胁:安全一致但有后门的 教师模型 可以将其隐藏的恶意行为传播到最初干净的 学生模型。在我们的威胁模型下,低至 3% 的中毒率会导致 学生模型 的攻击成功率 (ASR) 高达 70%。我们进一步确定了两种可以放大这种风险的训练选择。首先,即使中毒率较低,增加训练 epoch 的数量也会导致较高的 ASR。仅 10 个中毒样本,ASR 在 16 个 epoch 后达到 67%。其次,常用的 top-k KL 可以加速后门传输,导致触发条件有害行为在大多数情况下比采样的 token KL 更早出现。除了这些发现之外,我们还探索了一种简单的缓解措施——Lazy Defense,它会削减 KL 奖励,使 学生模型 更新不那么激进,限制激进更新并减缓后门学习。实验表明,Lazy Defense 在低中毒率设置下会延迟后门传输。总之,我们的研究结果表明 OPD 可以传播后门,这凸显了解决 OPD 安全风险的必要性。
