论文
用分块SVD寻找可用的权重机制
Finding Usable Weight Mechanisms with Tiled SVD
摘要
机制可解释性的主流做法是训练稀疏自编码器等代理词典,并用最大激活文本为特征命名。最好的此类图谱能识别概念,但这种身份存在于学到的词典中,而非网络权重本身。我们提出用列分块SVD直接从线性位点提取机制mount:每个mount是三元组(v,u,σ),可读作触发、写入和强度——身份即权重规则。我们以预注册的评估套件评估mount,以全写入能量提升而非tile局部提升作为判据。在Gemma-2-2B与WikiText-2(16,384-token子样本)上,全部七个线性映射均被评分:残差写入(mlp.down、attn.o)获得完整的A/B/C评级,可在子层后RMSNorm之后进行转向(steer),并通过52/52的位点-层测试;其余映射仅获A/B(mlp.gate/attn.q/attn.k/有效mlp.up/attn.v各26/26)。总计:182/182 GO。我们发布了库代码、语料构建器、实验入口点和单元测试。
