论文

保持性对宽度增长而言并不足够:稠密语言模型热启动的环境敏感选择

Preservation Is Not Enough for Width Growth: Regime-Sensitive Selection of Dense LM Warm Starts

模型训练预训练

摘要

宽度扩展为复用更小的因果语言模型检查点提供了一条实用途径,但仅凭零步保持性并不能解决如何选择加宽热启动的问题。我们将稠密宽度增长视为在完整训练状态(包括复制权重、优化器动量与调度器状态)之上的候选选择问题。在一个小规模TinyStories代理实验中,我们在匹配的继续训练预算下比较精确复制、扰动式、非对称重置与结构化非克隆热启动。我们在确定性与随机两种环境中评估零步保持性、短滞后探测指标与下游继续训练效用。结果图景是混合的,并通过缩减候选池的seed-1检查得到部分复现。精确复制的对称热启动在每一个已完成的16步探测中、以及在seed-0第1000与2000步加上缩减版seed-1第2000步的已完成随机128步继续训练中均排名第一。相比之下,结构化非克隆挑战者在确定性128步继续训练中胜出。因此,尽早脱离继承的克隆子空间并非普适的选择标准:它在长程确定性继续训练中有帮助,但在短滞后和随机继续训练下会误导。这一结论适用范围虽窄但有用:在此规模的稠密宽度增长中,保持性不是普适的排序准则,最佳替换信号同时取决于环境与滞后预算。

保持性对宽度增长而言并不足够:稠密语言模型热启动的环境敏感选择:论文配图
图 1:主要结构化非克隆挑战者的滞后预算和制度调节。每个点都显示 refsubspace_statecopy 和 exactcopy_symmetry 之间的验证损失 AUC 差距,计算为 refsubspace 减去 exactcopy,因此负值有利于 refsubspace_statecopy,正值有利于 exactcopy_symmetry。在确定性面板中,每个可用序列从 16 步探测向下移动到 128 步延续,并且种子 0 步 1000 系列加上两个步 2000 系列交叉到零以下。在随机面板中,所有可用序列都保持正值:seed-0 步骤 1000 系列在 128 个步骤中保持接近于零,而 Seed-0 和 Seed-1 步骤 2000 系列则进一步向正值移动。