论文
重写还是重加权?语言模型中的几何解释
Rewriting or Reweighting? A Geometric Account in Language Models
摘要
后训练显著改变了语言模型的行为,但聚合行为率并不能揭示训练是否移除了现有机制、创建了新的机制,还是改变了继承机制的使用方式。我们通过两种机制不同的失败来研究这个问题,重复作为解码吸引子病理,奴化作为偏好相关的对齐失败。我们引入行为流形分析,通过选择稀疏的行为关联坐标并将其拉入低维的局部图表来隔离行为特定的几何。我们在两个互补的空间中构建这些图表。ACT捕捉运行时激活状态,而NOC量化模型如何通过共享的行为关联子空间强地路由功能信息流。在多个模型家族中,结果的图表高度压缩且部分可对齐。贡献空间图表暴露一个更架构鲁棒的共享核心,而激活空间图表保留更强的家族特定结构。通过控制后的后训练,这些图表揭示了一致的不对称性。监督微调显著改变了继承的几何,而奖励优化则改变了行为,但保留了底层图表。这一几何视角为理解这两项目标之间的机制差异提供了一个统一框架。SFT倾向于重写行为几何,而奖励优化则主要重新权重。代码可在https://github.com/ronglingze/Manifold-Analysis获取。
