论文

大语言模型 预训练中的有限尺寸梯度传输:从级联尺寸到密集传输效率

Finite-Size Gradient Transport in Large Language Model Pretraining: From Cascade Size to Intensive Transport Efficiency

模型评测模型行为与机制分析

摘要

我们引入了真实语言的有限大小梯度传输框架 - 模型训练,基于五个可观察量 $(D,z,β,δ,v_{\mathrm{rel}})$,这些可观察量分别区分级联大小、持续时间、绝对传输和密集传输效率。我们分析了 Pico-LM 跨四个尺度和 125 个对齐步骤的直接原始梯度测量,以及由 153 个对齐的检查点差异更新字段构建的五尺度 Pythia 配套数据集。两个家族都具有相同的代数闭包,并且都具有接近统一的级联大小主干,但它们占据不同的传输机制:Pico-LM 显示出正的持续时间缩放和负的集约效率缩放,而 Pythia 仍然接近 $D=1$ 基线,只有较弱的正效率尺度依赖性。随机场控制在密集通道和持续时间通道中给出几乎匹配的零层,表明对比度反映了与共享零骨架的不同实际偏差,而不是不同的零校准。这些系列在逐步幂律压缩性方面也有所不同:Pico-LM 保留了清洁持续时间和效率幂律,而 Pythia 保留了尺寸骨干,但在这些通道中表现出较弱的单斜率压缩性。外部性能关联相应地是通道级的,主要由 $v_{\mathrm{rel}}$ 和归一化级联持续时间承载,而 $D(t)$ 充当共享大小骨干,没有显着的指数级性能关联。这些结果支持可重复使用的传输测量框架,而不需要通用固定点或神经缩放定律的第一原理推导。