用于诊断 Transformer 权重分布的双参数威布尔框架
A Two-Parameter Weibull Framework for Diagnosing Transformer Weight Distributions
摘要
我们应用威布尔分布(来自极值理论的二参数族)作为 Transformer 中元素权重大小分布的诊断框架。初始化时,i.i.d.高斯权重给出 |w| ~ HalfNormal,通过中等 80% 概率图拟合(本工作中使用的协议)产生 k ~ 1.20。这个锚点使 k 成为训练动态的有原则的、独立于架构的测量棒;在每个检查点的每一层独立拟合每个权重矩阵可以实现聚合统计无法解析的每组件、每层和每步骤诊断。将此框架应用于涵盖 7 个架构系列(Pythia、OLMo-1/2、LLaMA-3、Mistral、Qwen2.5/3)的 12 个模型条目揭示了三个发现。首先,FFN 模块和注意力输出投影 W_o(传输类)落在窄 k 带内:12 个条目中 [1.186, 1.204] 的中值终端 k(跨族 CV = 0.51%),在 SwiGLU/GeLU 激活、Pre-LN/QK-Norm 放置和 70M-14B 大小之间共享。其次,注意力输入投影 W_q、W_k(选择类)偏离 Weibull 系列,其严重性由存储决定:单独存储的 Q/K (OLMo-1、OLMo-2) 产生 [0.76, 0.99](深)中的 k; GQA 模型在 [1.10, 1.16] 中产生 k(温和); Pythia 合并的 W_qkv 占据一个单调跟踪训练预算 T/tau 的过渡区域。第三,lambda 在训练过程中大幅增长,并与 Pythia 家族中的 sqrt(eta/lambda_wd) 进行缩放(Pearson r = 0.94,三种传输类型),方向与 Fan 等人一致。 (2025)。这两个参数携带独立的信息:k 标记功能类别,lambda 标记训练进度。我们在 https://github.com/tiexinding/NPM-Weibull-public 发布了 npm-weibull-py v0.4 (Python 库)和 DATABASE_v9_1 。