论文

对比投影:通过差分 logits 镜头读取 Transformer 内部结构

Contrastive Projection: Reading Transformer Internals by Differencing Logit Lenses

模型评测模型行为与机制分析

摘要

读取 Transformer 在词元空间中的内部状态很容易做到,但很难信任:单个隐藏状态上的 logits 镜头在中间层由模型为几乎任何输入预测的通用词元主导。相反,我们读取了差异。减去两个紧密匹配的提示的隐藏状态并通过非嵌入进行投影可以取消共享组件并表面分离它们的内容,该操作相当于通过 logits 透镜读取 RepE/ActAdd 转向向量。内置于 无需训练 跟踪器中,该跟踪器在每个位置、子层和头部进行读取,并在设计的基线上进行平均,它跟踪 Phi-2 中的复合名词 MLP->注意力链,通过激活修补进行确认,通过读出和探测而不是通过修补在三种架构中恢复了相同的区别;它读取真实与虚构实体的检索表面,并将隐喻读取为一组域到域映射而不是单个比喻特征。交叉种子控制标记了边界:在仅初始化方面不同的五个网络中,相同的区别表面几乎完全不同的标记(前 10 个重叠 0.08)。词元空间中的计算是特定于网络的;它所得出的区别不是