论文
梯度平滑:耦合逐层更新以改进优化
Gradient Smoothing: Coupling Layer-wise Updates for Improved Optimization
摘要
具有重复架构块的深度神经网络(例如 Transformer)通常表现出训练期间出现的跨层结构化关系。受此观察的启发,我们引入了 \emph{深度方向梯度增强},这是一种通用的优化范例,其中应用于每一层的更新是通过沿深度维度转换块级优化器更新的集合来获得的。在此框架内,我们研究了 \emph{梯度平滑},这是一系列深度平滑方法,并使用简单的局部 \emph{窗口平滑} 算子对其进行实例化。由此产生的方法直接对任意基础优化器(例如 SGD、Adam、Muon)产生的块更新进行操作,产生最小的计算开销,并且与现有的优化管道兼容。我们评估了各种架构和训练体系中的梯度平滑,包括语言模型预训练、用于推理的 LLM 的 RL 后训练、扩散建模以及使用 Vision Transformer 进行图像分类。在这些设置中,梯度平滑可以持续提高优化和泛化性能,而无需修改模型架构或训练目标。我们进一步表明,它促进了跨深度的更加结构化的表示演化,这与其作为结构化深度预处理方法的解释一致。总之,这些结果将深度梯度增强确立为在优化中利用跨深度结构的有前景的框架,并证明梯度平滑是一种简单且广泛适用的实例。