论文

GRAIN:通过最小范数目标进行组聚合

GRAIN: Group Aggregation via Min-Norm Objective

模型训练预训练

摘要

学习不稳定是整个机器学习中长期存在的问题,但在定义现代深度学习的过度参数化机制中尤为严重:在有限数据上进行微调或训练的大型模型会遍历具有许多几乎等效最小值的平坦损失景观,并且随机因素(初始化、数据顺序、丢失、硬件非确定性)可以将优化路由到非常不同的解决方案。大型预训练模型(LPM)的兴起使问题变得更加紧迫:训练成本很高,下游数据通常很小,并且为了减少方差而重复运行是令人望而却步的。我们引入了 \textbf{GRAIN} (\textbf{G}roup \textbf{A}ggregation via m\textbf{IN}-norm Objective),这是一种轻量级训练算法,它用分组梯度的最小范数凸组合取代了小批量优化中使用的平均聚合(跨小批量和小批量内)。 \mName 保证聚合更新和每个组梯度之间的非负内积,解决批内和批内梯度冲突,并保留与 SGD 相当的 $\mathcal{O}(1/T)$ 收敛速度。在温和平滑度和绝对连续性假设下,最小范数解几乎肯定与算术平均值不同,这会产生 \mName 的均匀稳定性界限,严格比 SGD 的标准界限更严格。根据经验,在 LPM 规模的生成、分类和回归中,\mName 在一系列广泛的任务中提供了平均性能的持续改进和运行间方差的减少,除了单个向后传递之外,没有额外的训练时间或存储成本。