论文

残差流有效深度:全局累积状态诊断

The Residual Stream's Effective Depth

模型评测模型行为与机制分析

摘要

我们引入了 有效深度 ($\Deff$),这是一种标量诊断,它将Transformer的逐层残差流视为离散时间过程,测量表示相似性如何随层距离衰减,并将该轮廓聚合为一个数字。在 16 个仅解码器的语言模型中,$\Deff$ 将残差累积的结构结果与经验结果分开:即使是最大程度不同的正交更新也具有封闭形式参考 $F_L = 2L/(L+1)<2$,但 16 个默认测量值中有 15 个低于 $F_L$ (Qwen3.5: 32--44\%,OLMo-2:40--41\%,Pythia: 23--28%)。匹配的参考对照表明,差距不是由持续的初始状态或更新大小不平衡引起的,而很大程度上是相关残差更新的校准特征,而不是深度未使用的证据。对称位置 0、词元标准化和顶级 PC 控制表明该机制不能简化为 BOS 或顶级 PC 伪影:单独的上述参考默认异常值加入同一机制,并且在词元标准化或顶级 1-PC 删除后,所有 16 个模型都是低于参考值。中间检查点表明该机制在 OLMo-2 早期建立,并通过 5T token保持稳定,而 Pythia-1.4B 则遵循明显的下降轨迹。受控的残差传递干预支持该机制,并且 $\Deff$ 最好理解为 global 累积状态诊断,而不是能力评分或修剪方法。