论文

分解微调的深度剖面

Decomposing the Depth Profile of Fine-Tuning

模型评测模型行为与机制分析

摘要

微调 使预训练网络适应新目标。所得到的代表性变化的深度剖面是否反映了模型的内在属性或梯度流的大小尚未得到直接测试。我们在 240 个 微调 运行中测量了该配置文件,涵盖四个架构系列(编码器和解码器 Transformer、状态空间模型和 RNN)中的 15 个模型,参数规模从 125M 到 6.9B。代表性变化集中在每次标准训练运行中的输出近端层(除了一次之外)。我们应用每层控制,在每个优化器步骤之后跨层均衡$\|ΔW\|/\|W\|$。在这种控制下,轮廓在某些条件下持续存在,而在另一些条件下崩溃。在 125M--350M 时,顺序块架构(BERT、OPT、GPT-2)保留跨测试目标的斜率,而并行块架构(Pythia、CodeGen)仅针对因果语言建模目标保留斜率。这种架构区别在 1.3B--1.4B 处变窄,其中两种块类型都显示 CausalLM 的正等步斜率。在标准训练下,轮廓形状由两个附加轴描述:陡度在初始化时跟踪 无需训练 目标距离,轮廓宽度由体系结构主导。我们将局部梯度(表征变化的深度斜率)视为一种复合现象,其组成部分与尺度相关。