训练动力学:语言模型中出现、可塑性损失和电路控制的驱动成核率定律
The Kinetics of Training: A Driven-Nucleation Rate Law for Emergence, Plasticity Loss, and Circuit Control in Language Models
摘要
当语言模型电路的最后部分在一次随机尝试中对齐时,一种能力就会出现在语言模型中,而除了一个之外的所有部分都正确是毫无价值的。我们表明,这种无部分信用的联合调整是能力形成的速率限制步骤。两个指纹:在无快捷方式的设备中,五部分电路缺少三个,只要三部分电路缺少三个(1.19-1.37)就会等待,因此等待计算的是缺少的部分,而不是大小;在 Pythia 上,跨越 7 种能力和 3 个尺度,在 32 个区分单元中的 32 个中,消除一个部分会留下中位数为 17% 的能力,其中部分信用预测为 50-83% (p = 2e-10),而随机的非部分头部则留下 100%。一种罕见的事件,其屏障随着缺失的部分而增长,产生一个速率方程——站点 x 尝试 x 驱动器 x exp(-beta*K),减去破坏——读取三种方式,每种方式都预先注册了冻结常数。前进:一旦混合物通过浓度下限(上方 10/10,下方 0/12),在基线处持平的能力就会在我们选择的步骤中点燃,并且虽然仍持平,但其到达可从其前兆到 6 个保留模型上的 5% 中值误差进行计算。向后:学习被保留的能力的延迟随着等待而增加,直到过了关键的一步,它永远不会被点燃——但验证损失在整个过程中平稳下降,因此标准监视器对此视而不见。我们定位损坏(头提交到基础数据)并隔离解决方法:仅重新初始化查询键切片可以恢复可学习性(6/6),而值切片则不执行任何操作(0/6)。我们在受控门控注意力模型中证明了该机制:占领强制规定了最后期限,其后果不需要混合假设。已完成:SGD的噪声未通过波动耗散测试,因此我们安装了一个并按计划进行了退火、熔化和引脚电路。范围:Transformer 至 1.4B 中的结合电路。