论文
趋同是不可避免的吗?追踪输出同质性回到基本模型
Is Convergence Inevitable? Tracing Output Homogeneity Back to Base Models
摘要
LM 内容缺乏多样性被广泛归因于对齐过程,但这种崩溃是如何以及在何处开始的尚不清楚。我们认为输出同质性可能是在预训练阶段学习的,并且仅在对齐过程中显示或放大。具体来说,我们发现从第一个对齐阶段(指令调整阶段(SFT))观察到语义收敛,这表明同质性可能已经存在于预对齐模型中。为了研究这一点,我们进行了受控 SFT 实验,检查训练数据如何影响特定输入/输出对的输出收敛。我们发现 SFT 数据可以揭示和放大收敛,但不能引入收敛,这支持了其作为催化剂而不是原因的作用。为了进一步测试同质性是否起源于对齐之前,我们测量了基础模型的收敛性。我们发现,即使没有对齐,也可以通过单独提示来引发类似指令的崩溃。总而言之,我们的结果表明,语义收敛可能是从 LM 训练的目标中自然产生的,因此很难仅通过对齐后干预来缓解。