论文
相同的目标,不同的计算:后训练 如何跨模型层划分工作
Same Targets, Different Computation: How Post-Training Divides Work Across Model Layers
摘要
在 后训练 期间学习的后期层更改可能适用于基础模型的早期状态,或者可能取决于使用它学习的早期计算。我们通过四单元诊断来区分这些情况,该诊断将基础或后代上游状态与基础或后代后期堆栈交叉。较大的后叠加效应并不一定意味着对上游的强烈依赖。在数学提示上,OpenMath2 的后期堆栈在基本上游状态后将目标边距更改为 +3.43 logits,在其自身状态后将目标边距更改为 +3.28,从而实现接近零的交互。同一 Llama-3.1-8B 基础的几个遵循指令的后代表现出更大的依赖性,而受控代码和生物医学继续训练运行在公共支持上几乎为零;七个已发布的后代跨度为 -0.54 至 +2.20 logits。由于这些检查点在很多方面都有所不同,因此我们会隔离一个训练属性。两个 LoRA 微调可以学习熟悉的自然语言指令或新学习的随机数代码所请求的相同目标响应。仅改变这种提示-响应关系,Qwen3-4B 上的上游依赖性增加了 +5.56 logits,Llama-3.1-8B 上的上游依赖性增加了 +4.18,在所有六个逐个模型运行中均出现正配对转变。在我们测试的所有五个已发布的碱基/指令对中,交互作用也是积极的,并且后期堆栈替换在大约一半的事件中改变了全词汇表 argmax。因此,后训练 可以组织相同的目标行为,并在早期和后期计算之间具有不同的依赖关系。该诊断测量本地下一个词元兼容性,而不是自由运行的组件移植。