论文
删除、重新路由或重新缩放? 后训练和语言模型置信状态的因果商数
Erased, Rerouted, or Rescaled? Post-Training and the Causal Quotient of a Language Model's Belief State
摘要
当后训练不再奖励使用预训练模型已经编码的信息时,会发生什么情况?表示压缩的通用语言将三种命运混为一谈:信息可能会被删除、在仍然表示的情况下重新路由远离决策,或者在仍然表示和使用的情况下重新缩放以占用更少的方差。我们使这些命运在预训练恢复贝叶斯信念状态的模型中变得可识别。仅读取隐藏状态的粗略函数的奖励定义了精确的奖励空内核。内核让我们分别测量信息是否仍然可恢复,决策是否因果地依赖于它,以及它占据了多少激活方差。理论说明了什么是受保护的:KL 锚定强化学习保留了同等奖励输出之间参考策略的对数几率,监督目标和非锚定目标没有这样的约束,并且频谱压缩既不意味着删除也不意味着失去使用。在受控世界中,后训练主要会重新路由或重新调整无奖励信息并使其可解码。如果没有锚点,决策可以停止使用它,尽管表示仍然存在,而有了锚点,他们就会继续使用它。擦除仅在长时间的权重衰减下出现,因为奖励和下一个token预测都看不到区别。开放语言模型显示出相同的分离:上下文中的信念几何在后期层谱压缩下保持可解码,并且类内行为取决于锚。因此,后训练选择预训练信念状态的因果商:奖励定义决策等价,锚点和状态更新保护其忽略的部分内容,优化决定其余部分是否被删除、重新路由或重新缩放。
