论文

用分块SVD寻找可用的权重机制

Finding Usable Weight Mechanisms with Tiled SVD

模型评测模型行为与机制分析

摘要

机制可解释性的主流做法是训练稀疏自编码器等代理词典,并用最大激活文本为特征命名。最好的此类图谱能识别概念,但这种身份存在于学到的词典中,而非网络权重本身。我们提出用列分块SVD直接从线性位点提取机制mount:每个mount是三元组(v,u,σ),可读作触发、写入和强度——身份即权重规则。我们以预注册的评估套件评估mount,以全写入能量提升而非tile局部提升作为判据。在Gemma-2-2B与WikiText-2(16,384-token子样本)上,全部七个线性映射均被评分:残差写入(mlp.down、attn.o)获得完整的A/B/C评级,可在子层后RMSNorm之后进行转向(steer),并通过52/52的位点-层测试;其余映射仅获A/B(mlp.gate/attn.q/attn.k/有效mlp.up/attn.v各26/26)。总计:182/182 GO。我们发布了库代码、语料构建器、实验入口点和单元测试。

用分块SVD寻找可用的权重机制:论文配图
图1:一个Gemma式解码器块中的线性层(作为VisualTorch的缩放替身)。橙色ABOnlyLinear:attn.q/k/v、mlp.gate/up(仅A/B)。绿色ResidualWriteLinear:attn.o和mlp.down(A/B/C残差写入)。