论文
探索最小范数插值的镜头
Grokking through the Lens of Minimum-Norm Interpolation
摘要
Grokking 表明,拟合训练数据和学习底层信号可以发生在非常不同的阶段。然而,现有理论对于这种延迟泛化如何依赖于归纳偏差和信号结构提供了有限的定量见解。我们的工作通过开发一种统计理论来解决这一差距,该理论描述了正则化几何和信号稀疏性如何控制插值附近的泛化。特别是,我们关注高维回归的原型设置,并确定稀疏性促进正则化使精确插值比近似拟合更准确的机制。在强参数化的无噪声问题中,我们证明了零一泛化律,并构建了一系列凸范数,其插值器从全零预测器的微不足道的风险过渡到精确恢复,同时保持训练误差等于 $0$。此外,当特征维度和样本大小成比例时,我们沿着 $\ell_r$-正则化路径提供训练和泛化误差的精确表征。这反过来又使我们能够量化仍然接近插值的泛化增益:我们表明,随着范数变得更加稀疏,并且随着目标变得更加稀疏,这种增益会增加,无噪声数据和 $\ell_1$ 正则化所达到的泛化能力急剧下降。对角线性网络和接受模运算训练的Transformer的实验证明了我们理论预测的普遍性。最后,除了摸索之外,我们的工作揭示了最小范数插值的统计不稳定性:正则化强度的小扰动可能导致截然不同的泛化,同时保留较小的训练误差。