论文
预训练为下游任务适应提供可重用的频谱基础
Pretraining Induces a Reusable Spectral Basis for Downstream Task Adaptation
摘要
微调预训练模型发生在全参数空间的低维子空间中。先前的工作集中于描述这个优化子空间,但很大程度上忽略了补充问题:为什么在微调过程中某些方向仍未被探索?这些稳定的方向是否与下游任务无关,或者它们是否已经编码了不需要进一步调整的与任务相关的结构?回答这个问题对于理解预训练知识如何转移至关重要。通过跨视觉和语言模型的系统谱分析,我们表明预训练权重矩阵的前导奇异向量在微调下保持高度稳定,并且在不相关的下游任务之间共享,这表明预训练建立了一个可重用的谱坐标系。在较大数据集上预训练的模型在分布变化或任务变化下表现出更大的光谱稳定性,将预训练规模与几何可转移性直接联系起来。受这些发现的启发,我们提出了一种参数有效的方法,该方法冻结预训练的奇异向量并仅优化领先的谱系数,以 0.2% 的可训练参数在 GLUE 上实现具有竞争力的性能。我们的结果表明,稳定的方向编码可转移的结构而不是不相关的噪声:成功的预训练发现下游任务继承并在其中运行的频谱基础。