迹象始终存在:无需训练 原始 Transformer 尺寸中的概念检测和转向
The Signs Were Always There: Training-Free Concept Detection and Steering in Raw Transformer Dimensions
摘要
Transformer 隐藏状态的标准基础是 无需训练,用于检测概念并在语言模型中引导它们的架构通用特征基础;没有学过的字典。各个维度充当二进制寄存器,一次读取一个:它们的符号(+/-1)编码内容,它们的大小强度。特征只是具有一致符号模式的维度的子集,通过计算符号协议来读取。我们通过涵盖语言、视觉和音频的七个模型验证了 Bag of Dims (BoD) 框架;一次读取一个维度不会造成任何损失,因为全容量 MLP 在每个维度的读取上增加了零 AUC。相同的每维度符号出现在每种模态中,因此它们反映了 Transformer 训练本身,而不是语言目标。符号本身就带有预测内容:将所有量级设置为统一可以通过 LM 头保留 60-93% 的前 5 个下一个标记准确度。从单词元缓存(每个词元一次前向传递,无标签)中,我们通过计算符号协议以 AUC 0.97-0.99 检测 175 个类别,并且仅从随机种子发现扩展到每个模型 1500 个特征。经过训练的探针仅增加 +0.018 AUC 并收敛到轴对齐权重:旋转字典学习买的很少。符号具有因果作用:它们在注意力投射中幸存下来,并且在实时前向传播中翻转概念的符号模式会抑制它。阅读和指导是同一基础上的不同角色:一个概念的读者维度不是其作者维度。作者的目标同样便宜,即几个种子上的未嵌入行的总和,无需训练。通过闭环控制下的注意力输出路径注入,它将概念引导为四种语言模型上的流畅文本(十二个概念中的 62-92%)。这些标志始终处于标准基础之中;开放的问题不再是找到正确的旋转,而是对每个维度编码的内容进行编目。