论文
怎么样了?语言模型中的强化学习招募了功能福利轴
How's it going? Reinforcement learning in language models recruits a functional welfare axis
摘要
强化学习如何塑造语言模型的内部表征?我们提供的证据表明,强化学习招募了预先存在的功能福利表征:相对于其目标,对系统表现的好坏进行估计。我们在新颖的、语义中性的迷宫环境中训练几种语言模型。然后,我们提取奖励和惩罚轨迹的概念向量,并在与迷宫环境无关的设置中评估这些向量。惩罚向量的行为就像负面福利的代表:它促进失败和不可能的标记,它与负面情绪概念相一致,它负面地跟踪目标实现,并用它来引导负面的自我报告、病态的回溯、拒绝和不确定性。正奖励向量表现为镜像,两者几乎是反平行的。当控制图块到奖励映射、尺度、指令调整、RL 训练算法、模型系列和 LoRA 与完全微调时,这些效应是强大的,并且当我们用监督 微调 替换 RL 时,这些效应在很大程度上持续存在。重要的是,向量在经过迷宫训练之前在模型中是有效的。结合这些效应也出现在仅预训练模型中的观察结果,我们因此认为这个功能福利轴预先存在于 后训练:它是由 后训练 招募的,而不是创建的。虽然我们没有声明任何福利体验,但该轴提供了一个证明,即最小奖励信号可以通过招募预先存在的类似福利的表示来广泛影响模型行为,并对可解释性、后训练 动态和一致性产生影响。