论文

LayerNorm 作为循环 Transformer 中的隐式增益控制

LayerNorm as Implicit Gain Control in Looped Transformers

模型评测模型行为与机制分析

摘要

在预 LayerNorm 循环 Transformer 中,循环块内的 LayerNorm 充当隐式增益控制器:通过将块的局部 Lipschitz 常数与激活比例成反比耦合,它使循环雅可比行列式非正态——在每个经过验证的固定点处渐近收缩,即使其算子范数超过 1——因此真正的稳定性预算是频谱裕度,而不是算子范数界限。当进位 $ρ\to 1$ 时,该余量会耗尽,并且少数初始化根本不会收敛到固定点,因此对角进位约束 $ρ(\bar{A}) < 1$ 是必要的,但对于完全递归的收敛来说还不够。包括受控消融在内的六个任务的训练实验表明,线性进位不是深度记忆机制:梯度下降通过块更具表现力的非线性递归来路由记忆,并使稳定性受限的进位处于静止状态——进位的作用是稳定,而不是记忆。我们描述了这一主张的边界:在具有轴对齐每通道结构的任务中,梯度下降确实会招募进位。所有结果都是通过分析得出的,并在从头开始的 CPU 规模实施中进行验证;需要更大规模的验证。