论文

预雕利基:早期 LLM 训练中模块化任务分区的形成动态

Pre-carved Niches: The Formation Dynamics of Modular Task Partitions in Early LLM Training

模型评测模型行为与机制分析

摘要

大语言模型 展示了一种模块化的内部组织,反映了经过充分研究的人脑功能网络,但这种组织在训练过程中如何形成尚不清楚:之前的工作描述了完成的模型,而不是形成过程。我们逐步跟踪形成过程:我们从头开始训练 Pythia-410M 模型(两条轨迹,bf16 和 fp32),并在每一步运行归因修补,同时探测四个认知领域 14 个任务的梯度范数、有效更新、权重范数和一阶损失分解。三项发现。首先,模块化地图是预先雕刻的:在任何学习之前,主导任务对已经在归因基底(与任务无关的基线)的约 3.6 倍处重叠,并且其第 0 层集中度是该模型系列上的架构级常量。其次,分区通过两次急剧跳跃锁定,其幅度不跟踪学习率计划(第二次达到 20.4 sigma 安静窗口 / 6.2 sigma 全局),伴随着梯度水平的相对剥夺——获胜者收到失败者梯度供应的 2.25->2.73 倍,低于随机控制 9.5-11.5 个标准差——不会传播到更新或权重。第三,与基础的偏差仅出现在正在学习的领域中,这与模块化跟踪学习的假设一致。最后,我们将我们可以防御的特征级帐户与我们无法防御的机械问题分开,并且我们预先登记了我们正在进行的 2.8B 实验背后的规模阈值假设。