论文

语言模型激活位于特权纠错盆地

Language Model Activations Inhabit Privileged Error-Correcting Basins

模型评测模型行为与机制分析

摘要

语言模型表现出非凡的稳健性,即使它们的激活受到线性转向等干预措施的干扰,也能继续生成连贯的文本。我们假设这种鲁棒性是被动动力学的结果,即前向传递中的约束机制将激活集中到产生相干输出的“好”区域。为了研究这些假设的纠错机制,我们通过观察模型层在低维曲线上的行为来探针语言模型激活空间的几何形状。在此过程中,我们发现模型激活发生在一组不同的吸引盆地内,这在几何上将自然激活与分布相似的合成激活区分开来。将这个镜头应用于语言模型转向,我们沿着语义转向方向观察特定特征的盆地,并发现转向在这些盆地之间移动激活。为了证明这种几何结构在神经计算中的积极作用,我们表明,自适应调节转向强度以跨盆地传输激活可以改善语言间转向,与固定强度转向相比,显着增加从目标语言采样token的概率。我们的研究结果表明,激活空间几何分析是解释和控制语言模型的一种有前途的方法。