论文
矩估计的信赖域框架
A Trust-region Framework for Moment Estimation
摘要
在本文中,我们开发了一个信任域框架,用于理解随机梯度优化中自适应矩估计机制(例如 \textsc{Adam})的行为。具体来说,与每个单独参数相关的更新步骤的大小受到有限阶 $p$ 矩信任区域的约束,其中 $p\ge1$。由此产生的推导导致了一系列基于二阶矩估计和标准化 $p$ 矩估计的学习率机制。对于 $p=4$,这涉及峰度估计。随后的推导提供了对基于矩估计的归一化、学习率调度、作为谱一阶低通正则化的动量以及公共信赖域框架内的算子级谱范数归一化的统一解释。在 FineWeb-Edu 和 TinyStories 上训练的 GPT2-124M 的初步实验表明,当信任域约束较弱时,第四矩实现提供了最大的好处。随着逐渐增强的信任域控制的引入,第二时刻的实现变得越来越有竞争力,通常比相应的第四时刻的实现实现略低的验证损失。