论文
数据可预测性塑造 Transformer 训练中威布尔体重秤的增长
Data Predictability Shapes Weibull Weight-Scale Growth in Transformer Training
摘要
经过训练的 Transformer 的权重大小可以通过两参数威布尔分布来概括,其形状 $k \approx 1.2$ 在各层和模型中都是稳定的,因此尺度 $λ$ 承载了大多数训练引起的运动。什么语料库属性决定 $λ$ 增长多少?使用二元条件熵 $D = H(\text{next} \mid \text{prev})$(训练前计算的 无需训练 统计量),我们在受控腐败家族中发现了一个学习率条件定律,$λ^2 - λ_0^2 = C_0(η) + C_1(η)(H_r - D)^{0.59}$,其中 $H_r$ 是匹配预算洗牌基线。凸指数继承自独立测量的数据侧饱和关系,而不是直接拟合到增长曲线。删除两个 per-$η$ 系数后,跨越学习率一个数量级的 23 个运行崩溃到单位斜率的 $(H_r - D)^{0.59}$ 上($R^2 = 0.941$;直接 per-$η$ 拟合较弱,$R^2 \approx 0.82$)。由于 $D$ 是在训练之前计算的,因此该定律是一个前向预测器:端到端的自我验证以 5.7% 的相对误差恢复了家庭内体重增长。读数保持模型和每层分辨率,并跨越两个测试的架构,保留功能形式,仅改变系数。它还标记了它的边界:跨语料库预测过度预测代码,暗示冗余是更广泛的 $Φ(D,R,A,H)$ 数据权重框架的第二个轴。