论文
注释缓解 后训练 模式崩溃
Annotations Mitigate Post-Training Mode Collapse
摘要
后训练(通过受监督的 微调)改进了指令跟踪,但通常会通过将模型偏向低熵 微调 数据而导致语义模式崩溃,而牺牲高熵预训练分布。至关重要的是,我们发现这种权衡随着规模的扩大而恶化。为了弥补这种语义多样性差距,我们提出了注释锚定训练,这是一种原则方法,使模型能够采用 后训练 的偏好遵循行为,而不牺牲预训练的固有多样性。我们的方法很简单:我们对与语义注释配对的文档进行预训练,产生丰富的注释分布,反映预训练数据的全部范围,并在 后训练 期间保留这种分布。这使我们能够在推理时对不同的注释进行采样,并将它们用作指导生成的锚点,从而有效地将预训练的语义丰富性转移到训练后的模型中。我们发现,与使用 SFT 训练的模型相比,使用注释锚定训练训练的模型可以减少 6 美元的多样性崩溃,并且随着规模的扩大而提高。