论文

后训练 中的输出多样性在哪里崩溃?

Where does output diversity collapse in post-training?

模型评测模型行为与机制分析

摘要

训练后的语言模型产生的输出比基础模型的输出变化要小。这种输出多样性的崩溃破坏了依赖于不同样本的推理时间缩放方法,并且存在使创造性和有价值的任务的模型输出同质化的风险。先前的工作属性崩溃为特定的 后训练 方法,没有将训练数据组合的作用与方法分开,或者将生成格式与模型权重分开。我们通过 Olmo 3、Think(思想链 蒸馏)、Instruct(广泛的多源数据)和 RL-Zero 的三个并行 后训练 谱系,跨 15 个任务和四个文本多样性指标来跟踪输出多样性。我们发现崩溃的位置与数据组成共同变化:Think 谱系在监督 微调 处失去了大部分语义多样性,并且 DPO 在 Instruct 中的影响比在 Think 中更大。在 Think 模型中抑制推理时的思想链推理会降低困难任务的准确性,但答案级别的多样性保持不变,这表明崩溃是由训练数据嵌入到模型权重中的,而不是由生成格式强加的。将六个可验证任务的多样性损失分解为质量控制部分(去除不正确的输出)和残差部分(正确输出的真正缩小范围)表明,分割是依赖于任务的,Think 模型比 Instruct 保留了更多的正确答案多样性,尽管总体上崩溃更多。我们的结果表明,多样性崩溃是在训练期间由数据组合决定的,不能仅在推理时解决。