论文

删除、重新路由或重新缩放? 后训练和语言模型置信状态的因果商数

Erased, Rerouted, or Rescaled? Post-Training and the Causal Quotient of a Language Model's Belief State

模型评测模型行为与机制分析

摘要

当后训练不再奖励使用预训练模型已经编码的信息时,会发生什么情况?表示压缩的通用语言将三种命运混为一谈:信息可能会被删除、在仍然表示的情况下重新路由远离决策,或者在仍然表示和使用的情况下重新缩放以占用更少的方差。我们使这些命运在预训练恢复贝叶斯信念状态的模型中变得可识别。仅读取隐藏状态的粗略函数的奖励定义了精确的奖励空内核。内核让我们分别测量信息是否仍然可恢复,决策是否因果地依赖于它,以及它占据了多少激活方差。理论说明了什么是受保护的:KL 锚定强化学习保留了同等奖励输出之间参考策略的对数几率,监督目标和非锚定目标没有这样的约束,并且频谱压缩既不意味着删除也不意味着失去使用。在受控世界中,后训练主要会重新路由或重新调整无奖励信息并使其可解码。如果没有锚点,决策可以停止使用它,尽管表示仍然存在,而有了锚点,他们就会继续使用它。擦除仅在长时间的权重衰减下出现,因为奖励和下一个token预测都看不到区别。开放语言模型显示出相同的分离:上下文中的信念几何在后期层谱压缩下保持可解码,并且类内行为取决于锚。因此,后训练选择预训练信念状态的因果商:奖励定义决策等价,锚点和状态更新保护其忽略的部分内容,优化决定其余部分是否被删除、重新路由或重新缩放。

删除、重新路由或重新缩放? 后训练和语言模型置信状态的因果商数的原论文方法或结果图
图 1:从信仰状态到它的命运。 I. 具有任务和干扰变量的隐马尔可夫过程生成token,预训练的 Transformer 表示置信状态 $b_{t}$。奖励仅读取类边际 $b^{\kappa}$(大单纯形)。共享它的信念形成了一种无奖励纤维(小单纯形),其中一个方向是下一个token可以看到的方向,另一个方向是它看不到的。每张卡片都显示表示(平面)中的一根光纤及其点映射到的决策(轨迹;虚线:基本模型):擦除(折叠)、重新路由(完整,每个点映射到一个决策)或重新缩放(缩小,映射到与以前相同的决策),命运的签名为 $R$、$U$ 和 $A$。二至四。预览中的三个结果(III 中的空心圆圈:具有重量衰减的长训练)。