论文
Forking:重播下突然过度拟合
Forking: Sudden Overfitting Under Replay
摘要
本文研究了分叉,这是 NanoGPT 自动研究中发现的泛化失败。在数据重播下,具有过度编码 n-gram 内存分支的模型在纪元边界处显示出训练和验证损失的明显分离,类似于分叉的形状。我们在受控的普通 NanoGPT 设置中研究这种现象,并使用 Engram 在 DeepSeek 式模型中重现它。从机制上讲,重复更新会锐化训练中观察到的连续性,同时抑制未见连续性的概率,其损失随着每次传递而增加。 n-gram 模块创建了弱交互的特定于上下文的子空间,从而放大了这种效果。低频环境造成了大部分差距,而较大的训练预算和拥挤的桌子则抑制了这一差距。我们还观察到短期预算、大量重复的 SFT 和类似 RL 的制度中的分叉。本文的贡献有两个:(1)分叉揭示了深度学习中除了 grokking 和双下降之外的另一个奇怪现象。 (2) 分叉是自动研究Agent提出的技巧的意外且令人不快的副产品。虽然这些药物产生了大量看似有用的结果,但我们应该始终谨慎对待它们的结果。