权重衰减转向 Transformer 损失景观 Villani:优化和泛化的功能分析基础
Weight-Decay Turns Transformer Loss Landscapes Villani: Functional-Analytic Foundations for Optimization and Generalization
摘要
权重衰减在 大语言模型 中被广泛用作正则化器,但其在塑造 Transformer 损失景观中的精确作用在理论上仍未得到充分探索。本文通过证明标准 Transformer 目标(具有 $L^2$ 正则化的交叉熵损失)满足 Villani 的强制能量函数标准,首次提供了严格的函数分析表征。具体来说,我们证明正则化损失 $\mathcal{F}$ 是无限可微的,至少以二次方增长,具有高斯可积尾部,并且满足微分增长条件 $-Δ\mathcal{F} + \tfrac{1}{s}\|\nabla\mathcal{F}\|^{2} \to \infty$ 作为 $\|θ\|对于所有 $s>0$,\ 到 \infty$。从这个结构中,我们推导出显式的 log-Sobolev 和 Poincaré 常数 $C_{\mathrm{LS}} \leq λ^{-1} + d/λ^{2}$,将正则化强度 $λ$ 和模型维度 $d$ 与有限时间收敛保证联系起来,以保证噪声随机梯度下降和随着 $λ$ 的增加而收紧的 PAC-贝叶斯泛化边界。为了验证我们的理论,我们引入了可扩展的 Villani 诊断 $Ψ_s(θ) = -Δ\mathcal{F} + s^{-1}\|\nabla \mathcal{F}\|^2$,并在具有超过 100M 参数的模型中使用 Hutchinson 跟踪探针对其进行有效估计。 Penn Treebank 和 WikiText-103 上的 GPT-Neo-125M 实验证实了预测的 $Ψ_s$ 二次增长、Hessian 矩阵的谱膨胀以及与我们的 log-Sobolev 分析一致的指数收敛行为。这些结果表明,权重衰减不仅在经验上提高了泛化能力,而且还建立了深度学习中快速朗之万混合和理论上基于曲率感知优化所需的数学条件。