论文
预训练课程启用选择性 微调
Pretraining Curricula Enable Selective Fine-tuning
摘要
Transformer 遵循隐性课程,其中某些任务先于其他任务学习。然而,明确的预训练课程如何影响 微调 的学习、泛化和选择性尚不清楚。这对于 AI 安全非常重要,其中 微调 用于选择性抑制失调行为。在这里,我们比较以平衡(均匀采样)或不平衡(一个任务早,另一个晚)方式预训练任务的课程。我们表明,两个冲突的复制任务的不平衡学习促进了上下文学习并提高了拒绝 微调 的选择性。消融和激活修补表明,出现这种情况是因为不平衡的预训练鼓励任务在可分离的神经回路中分离,而平衡的训练通过共同的路径路由这两项任务。我们将这些发现扩展到涉及规则一致和违反规则的数据的合成语言学习任务,其中不平衡的课程同样会导致更本地化、更少纠缠的规则表示,从而导致更稳健的规则遵循行为。总之,这些结果表明,不平衡的预训练课程可能是促进解开表示的重要工具,对安全 微调 的精度和可靠性产生直接影响。