论文
用学到的新词在训练中进行接种
Inoculation Midtraining with Learned Neologisms
摘要
大型语言模型 (LLM) 通常会在训练后学习所需和不需要的属性。我们研究训练中期(早期训练阶段)是否可以塑造这些属性中的哪些属性稍后可以推广。我们引入了接种中期训练(Inoculation Midtraining),这是一种教导基本模型不安全行为属于指定 <quarantine_token> 上下文的技术,如训练中期引入的 <quarantine_token> 新词(一种新词元)所示,然后在该上下文中使用不安全数据对模型进行后期训练。然后,我们在上下文之外评估模型,并从系统提示中排除 <quarantine_token> 新词。在监督微调和强化学习后训练制度中,我们发现接种中期训练可以减少错位,同时保留良性数据属性的传输(例如,用德语或莎士比亚散文说话)。然而,我们的方法并没有优于标准的接种提示,对训练配置很敏感,并且产生了附近的上下文提示可以重新激活的泄漏边界。这些结果表明,通过训练中期引入的学习关联的接种可以形成选择性泛化。尽管如此,在这种方法成为开发人员安全框架中的承载组件之前,还需要做更多的工作。