论文
训练前干预,事后干预:跨检查点嫁接模型信念
Pre-training interventions, ex post facto: Grafting model beliefs across checkpoints
摘要
预训练干预对于一致性研究至关重要,因为预训练期间形成的信念决定了模型如何从后续训练中推广。最近流行的一种此类干预技术是合成文档微调(SDF),其目的是改变模型所相信的内容。理想情况下,合成文档将混合到训练前或训练中,但对训练前语料库的每次更改都必须先进行完整的后训练运行,然后才能测量其效果,这使得迭代缓慢且昂贵。通常的做法是将 SDF 应用于已经经过训练的模型。众所周知,这会留下工件并降低功能,并且正如我们所展示的,它使模型将与文档无关的捏造实体视为真实的,我们将这种失败称为现实漂移。我们建议嫁接:在预训练的检查点上训练 SDF 适配器,然后将学习到的权重更新添加到后训练的模型中,这在重用现有的后训练的同时近似忠实的方法。我们通过在高达 284B 参数的模型家族中安装虚假事实、训练错位的模型生物体以及应用宪法中期训练干预来证明这一点。嫁接将目标信念与 SDF 一样强烈地安装在后训练模型上,同时将现实漂移和偏好一致性的损失平均减少一半以上,并且更接近忠实的训练中期运行。由于移植不需要后训练,因此相同的适配器可以应用于任何后续检查点,使研究人员能够快速迭代预训练干预措施,而只需一次微调运行。