论文
蒸馏提示模板会改变学生模型已有安全对齐
Understanding the Role of Prompt Template in Knowledge Distillation for Safety Alignment
摘要
先前研究发现,监督微调的提示模板会明显影响后续安全对齐的稳健性,但教师到学生知识蒸馏中的模板影响尚不清楚。本文分析不同模板配置如何改变学生已有的安全对齐,观察到已对齐指令底座的安全性显著退化。具体而言,相较非聊天模板,聊天模板使模型更容易服从有害请求。这一发现在LLaMA、Gemma、Qwen三个模型家族和多个安全基准上保持一致。进一步分析显示,非聊天模板蒸馏更好地保留学生底座的内部表征,而聊天模板引起更大的表征偏移。代码:https://github.com/anjilab/role-of-prompt-template-in-kd。
