论文

布线击败混合:Transformer 缩小尺寸的结构感知补偿

Wiring Beats Blending: Structure-Aware Compensation for Transformer Downscaling

模型优化模型压缩

摘要

模范家庭是按规模进行训练的。可以将预训练的大型模型转换为较小的同级模型吗?我们研究Pythia中1.4B->410M端到端的转换。不同尺寸的表示强烈对齐(脊 R^2=0.84);参数对齐较弱。密集的重量投射具有破坏性;位精确控制将错误置于基础混合中,从而破坏了旋转、每头、GELU 和 LayerNorm 结构。最佳拟合线性算子之后的残差在随机控制下不携带可学习或可转移的信号,因此转换值存在于初始化中。匹配预算续 预训练 分离了两个独立的杠杆:最小二乘补偿(功能杠杆,最佳零样本)和方差保留重新调整(动态杠杆,最佳端点)。布局遵循架构:补偿正好处于剪切和读取之间没有标准化的位置;规范导向的路径需要重新调整。薪酬是一种低预算、象征性效率的胜利,而不是普遍的胜利。在 30M 标记下,它击败了宽度缩减对(84.0+-1.8 与 89.7+-3.7,3/3 种子)和保留深度缩减对(109.3 与 117.9,3/3 种子)上的最佳亚克隆变体。给定相同激活统计数据的选择恢复到该间隙的一半以下(3/3 种子):增益是重新拟合,而不是信息。在预算的 33 倍下,两者达到了平价(40.3+-0.3 与 40.3+-0.5,3 个种子),两者都远远领先于从头开始,转移总是击败(在低预算下高达 18 倍,在收敛和最大规模下缩小)。在约 5 倍的供体规模 (6.9B->1.4B) 下,堆叠两个杠杆会过度校正,与大宽度下的病态补偿解决方案一致,指出尺寸感知正则化作为修复。该 init 还以匹配的预算击败了结构化修剪加上 蒸馏(标准管道),并与其结合进一步改进。代码、检查点和冻结的评估语料库均已发布。