论文
语言模型中 Grokking 的 预训练 类比:追踪延迟语法泛化
A Pre-Training Analogue of Grokking in Language Models: Tracing Delayed Grammatical Generalization
摘要
Grokking 是神经网络在拟合训练数据后很长时间内进行泛化的现象,已在许多时期的监督环境中进行了研究。 LLM 预训练 相反涉及对未标记语料库的下一个标记预测,数据重复有限,并且没有明确的训练/验证分割。为了解决这个问题,我们提出了一个基于暴露的框架,可以在 LLM 预训练 期间研究类似神探的动力学。我们的评估基于 BLiMP 最小对,它提供了受控的语法对比。对于每个 BLiMP 最小对,我们确定一个关键短语,即捕获语法对比和现象相关上下文的最小连续跨度。关键短语出现在 预训练 窗口中的示例被分配给 proxy-train split;其余示例分配给代理验证拆分。在五种语法现象中,我们观察到延迟泛化。分析泛化前后的 预训练 检查点表明,语法概念向量更能预测语法可接受性,并在泛化后占据更高维的子空间。我们还发现,从关键标记到相关上下文标记的注意力集中在少数头部中。