后训练改变LLM写作风格,评审偏好未同步变化
The Judge Is Not Its Twin: Post-training makes a model's writing more predictable but barely moves its taste, as a judge, toward predictable writing
摘要
现在,语言模型通常由其他语言模型进行评分。如果训练后使模型自己的写作更加可预测,它也可以教导同一模型充当评审,奖励可预测的写作,这样创造力的进步对于自动评估来说是看不见的。我们跟踪两个开放模型系列 OLMo-2 和 Zephyr(各 7B 参数),通过它们的公共训练阶段,并作为短篇小说作家和成对故事的评判者对每个阶段进行两次测量。作为作家,模型的漂移正如人们所担心的那样:每个家庭经过充分训练的模型发现其基础、监督微调 (SFT) 和偏好训练 (DPO) 阶段的故事在所有十个提示中都逐渐变得更加熟悉,而来自另一个家庭的模型发现经过训练的故事每个词元 7.0% 到 9.2% (OLMo-2) 和 24% 到 25% (Zephyr) 不那么令人惊讶。作为评审,他们几乎不会走向可预测的写作。当被问到哪个故事更好时,每个评审都可以用这个问题来用自己的话按照打乱的顺序讲述一个故事,训练有素的评审对更可预测的故事的估计倾向不会在选择它的概率上增加一个百分点。事后单边的 95% 增长上限为平均对 2.7 点,大约是未经训练的 OLMo-2 评审自己倾斜的大小。当被问及哪一个更有创意时,受过训练的评审的估计不会比其基础的更倾向于可预测的故事。相反,当问题是创造力时,训练会强化对较长故事的偏好,并且对于一个答案槽,它打破了“更具创造性”作为一个问题:训练有素的评审要求它不再可靠地更喜欢故事而不是乱七八糟的文字。后续无法建立可预测性不同但质量不同的配对,因为使作者的故事变得更不可预测的路线也破坏了其中一些,通常足以使预先设置的质量地板失败。