论文

低秩适配器也能发挥大作用:您只需要带有 LoRA 适配器的随机支架

A Little Rank Goes a Long Way: Random Scaffolds with LoRA Adapters Are All You Need

模型训练参数高效训练

摘要

神经网络的多少参数实际上编码了特定于任务的信息?我们用 LottaLoRA 来研究这个问题,LottaLoRA 是一种训练范例,其中每个主干权重都是随机抽取并冻结的;仅训练低秩 LoRA 适配器。在涵盖从单层分类器到 900M 参数 Transformer 的不同架构系列的九个基准测试中,冻结随机主干上的低秩适配器恢复了 96-100% 的完全训练性能,同时仅训练 0.5-40% 的参数。因此,特定于任务的信号占据的子空间数量级小于完整参数计数所建议的数量级。三个机制研究结果支持了这一结果:(1)当静态时,冻结的主干被积极利用,学习到的缩放~$β$在所有架构中都保持严格的正值,但当支架不稳定时,优化器会使其沉默,LoRA因子会吸收所有任务信息; (2) 冻结主干是更好的,但可以互换,任何随机初始化都同样有效,只要它在整个训练过程中保持固定; (3) 性能饱和的最低 LoRA 等级估计任务的内在维度,让人想起主成分分析 (PCA) 中保留的成分数量。该结构在形式上类似于沿前馈网络的深度轴展开的储层计算。由于主干网仅由随机种子决定,因此模型可以作为适配器进行分发,加上种子随任务复杂性而不是模型大小而增长的足迹,因此存储和内存节省随着架构的扩展而增加。