论文

关于大型语言模型中潜意识学习的缓解

On Mitigation of Subliminal Learning in Large Language Models

模型训练监督微调与指令调优

摘要

知识蒸馏可以通过在语义上与这些特征无关的训练数据将非预期的行为特征从教师模型传递给学生,这种现象称为潜意识学习。尽管最近的工作已经证实了这种效应,但其训练动态和缓解方法仍未得到充分探索。我们研究开放权重语言模型中的潜意识学习,参数范围从 1.5B 到 8B 参数,涵盖数字序列和思维链设置中的 Qwen、Gemma 和 Llama 家族。我们不是只评估最终模型,而是在整个微调过程中跟踪与特质相关的概率,并发现潜意识习得可能是高度非单调的,具有短暂的尖峰、逆转和特定特质的转移失败。然后,我们引入阈值训练,这是一种退火的 KL 正则化微调方法,可限制与基础模型的早期漂移。在我们的实验中,阈值训练大大减少了阈下特征的获得,同时在很大程度上保留了任务收益,作为缓解策略,其表现优于释义和分层冻结。这种效应还超出了动物偏好的范围:在一项法语反应式实验中,阈值训练抑制了语言迁移,同时保留了 GSM8K 的大部分改进。最后,我们表明 KL 时机很重要:早期正则化比晚期正则化更有效,并且扫描正则化强度揭示了任务学习和特质抑制之间的实证权衡。