论文

重写还是重加权?语言模型中的几何解释

Rewriting or Reweighting? A Geometric Account in Language Models

模型评测模型行为与机制分析

摘要

后训练显著改变了语言模型的行为,但聚合行为率并不能揭示训练是否移除了现有机制、创建了新的机制,还是改变了继承机制的使用方式。我们通过两种机制不同的失败来研究这个问题,重复作为解码吸引子病理,奴化作为偏好相关的对齐失败。我们引入行为流形分析,通过选择稀疏的行为关联坐标并将其拉入低维的局部图表来隔离行为特定的几何。我们在两个互补的空间中构建这些图表。ACT捕捉运行时激活状态,而NOC量化模型如何通过共享的行为关联子空间强地路由功能信息流。在多个模型家族中,结果的图表高度压缩且部分可对齐。贡献空间图表暴露一个更架构鲁棒的共享核心,而激活空间图表保留更强的家族特定结构。通过控制后的后训练,这些图表揭示了一致的不对称性。监督微调显著改变了继承的几何,而奖励优化则改变了行为,但保留了底层图表。这一几何视角为理解这两项目标之间的机制差异提供了一个统一框架。SFT倾向于重写行为几何,而奖励优化则主要重新权重。代码可在https://github.com/ronglingze/Manifold-Analysis获取。

重写还是重加权?语言模型中的几何解释:论文配图
图15:跨模型稀疏分类器方向得分的对齐。每个单元格表示两个模型在匹配样本上的分类器得分之间的皮尔逊相关系数绝对值。较高的绝对相关性表明,独立拟合的监督方向在不同架构和规模之间具有较强的得分对应关系,整体符号可能相反。由于这些方向由标签监督得到,该结果只作为补充的合理性检查,而非无监督图表普适性的主要证据。