论文

存储在优化器状态,​​受到以后训练的重视:潜意识特质转移的因果解释

Stored in Optimizer State, Valued by Later Training: A Causal Account of Subliminal Trait Transfer

模型评测模型行为与机制分析

摘要

潜意识特质转移允许学生模型从教师生成的数据中获取行为倾向,而这些数据中的特质并未以语义方式表达。最近的工作解释了这些信号如何进入梯度,但没有解释它们如何在源移除后幸存下来或在以后的训练中获得不同的信号。我们将参数和优化器矩视为单个训练器状态,并导出精确的传输评估恒等式,将源扰动的独立于观察者的传播与未来延续和行为读出分配的值分开。状态手术将第一时刻识别为因果载体。单独移植它会使参数、隐藏状态和输出在剪切时保持不变,但无源更新会产生不断增长的参数和隐藏状态差异;第一时刻移植参数可以恢复最终行为反应。通过匹配的期货发送相同的源引起的差异会产生负、接近零和正的 Qwen 效应(-0.658、+0.008 和 +0.658 种子均值)。经过八次更新后,这种排序在所有 12 个 Llama-3.2-1B 种子中重复出现,而状态差异规范在各路由之间几乎保持相同。当延续延伸到十六次更新时,这两种对比在每对种子中都会增强。全地平线肋骨可以预测所有 42 个 Qwen 路线平均标志和所有 21 个解析的 Llama 普通路线标志。独立于观察者的传输也在 Qwen、SmolLM2 和 Llama 之间复制,而完全状态递归则预测非 LoRA MNIST 系统中的物理、隐藏和固定头响应,包括使用 AdamW 和动量 SGD 训练的 CNN。总之,这些结果确定了潜意识特征转移的两阶段机制:优化器状态传输源扰动,随后的训练确定其行为价值。