论文

借用几何:冷冻预训练 Gemma 4 31B 的交叉分布头重要度指纹

Borrowed Geometry: Cross-Distribution Head-Importance Fingerprints of Frozen Pretrained Gemma 4 31B

模型评测模型行为与机制分析

摘要

Frozen Gemma 4 31B 权重专门针对文本进行预训练,未经修改,通过薄的可训练界面传输到从未处理过的非文本模式。在 L24-L29 切片(192 个注意力头)上,英语文本 TxtCopy 注意力探针(95 个句子)和每个头消融对四个非语言标记模式任务(二进制复制、联想回忆、一维细胞自动机规则 90、二进制加法)的影响将四个头(L26.28、L27.28、L27.2、L27.3)联合分类为顶级信号。切片级联合重合在超几何零值($P = 0.0013$、$N=192$、$K=38$、$n=4$)下非常显着,并且通过了多重性感知排列测试($P_{V4} = 0.013$)。预训练的 Gemma L26 在 OGBenchcube-double-play-task1 上达到 60.22%,而随机初始化 Gemma 则达到约 1%($+59$pt at $n=3$);具有正确 $1/\sqrt{d_k}$ 缩放的 FrozenRandom-GPT2 控件也会失败。头级因果验证:在经过训练的立方体任务 1 IQL 代理中将 L26.28 归零,成功率下降 $63.3\% \ 至 10.0\%$,而层匹配的低 TxtCopy 阴性对照则为 $46.7\%$($n=30$ 处的特异性为 $3.2\times$;$n=5$ 配对-$t$ $p=0.039$)。完整的 L26 扫描将 L26.28 排在 32 中的第 4 位。诚实的否定:L26 Spearman $ρ(\text{TxtCopy, drop}) = +0.37$(与层内因果读取相反);单头激活修补不传输匹配变量;仅靠 4 个指定的负责人不足以完成任何任务; Walker2d-DT 和 scene-task1 在指定切片之外招募 L24,并显示无效的头部切除特异性。我们将贡献构建为切片级别的跨分布重要性指纹加上一个跨模态目标的头部级别因果证据。