论文

为了谁的安全?用于受控 LLM 安全拒绝的边界感知自我 蒸馏

Safety for Whom? Boundary-Aware Self-Distillation for Controlled LLM Safety Refusal

模型训练合成数据

摘要

安全调整通常作为主题级问题提出:这个主题有害吗?部署要求范围更窄。公民导师和公共部门助理可能共享一个基本模型,但在同一主题内需要不同的边界,拒绝有针对性的政治操纵,同时仍然回答有关同一选举的事实问题。我们将其表述为窄边界安全,并引入了一个离线自生成框架,结合了受控主题生成、覆盖修复、分布补偿数据以及用于训练和评估的有害-良性对。单次生成留下 19.88% 的提示没有接受的拒绝痕迹,而逐步升级重试留下 0.20%。在 Qwen3-8B 的政治说服方面,通过 Escalate 完成的拒绝数据训练将目标域拒绝率从 9.47% 增加到 84.75%,并将三个更广泛的危害基准的平均不安全响应率从 26.26% 降低到 0.14%,但将 XSTest 过度拒绝率从 2.00% 增加到 74.00%。在单独的匹配比较中,用经过验证的目标模型响应替换外部响应将过度拒绝从 15.20% 降低到 5.20%。边界对数据将遵守方对保留对的过度拒绝从 32.94% 减少到 4.16%,而有害方拒绝仅从 91.88% 减少到 87.72%。这些结果表明,数据组合控制着安全性和可用性的权衡,并且应该在预期拒绝边界的两侧评估安全对齐。