论文

超越凸性的驯服次梯度未调整 Langevin 算法

The Tamed Subgradient Unadjusted Langevin Algorithm beyond Convexity

模型训练预训练

摘要

我们研究从目标分布中采样的问题,该目标分布的势同时是非平滑的、受超线性梯度增长影响并且是非凸的。我们引入了次梯度驯化未调整朗之万算法(SG-TULA),这是朗之万扩散的离散化,直接对次梯度进行操作,而不依赖于计算要求较高的平滑程序。为了处理超线性状态,采用驯服技术来产生稳定、明确的方案。我们推导出 Wasserstein-2 距离的非渐近收敛界限,并根据维数和逆温度明确跟踪所有常数,从而改进了基于次梯度的 Langevin 算法的当前已知速率。我们进一步为相关的优化问题提供超额风险估计。我们使用显式常量验证了 GPT-2 谱系中 LLM 的正则化预训练潜力的假设,以及 SG-TULA 的增强坐标方式变体对前者进行了预训练,与微调的 AdamW 和 Muon 竞争,目前没有可比的非渐近保证。