论文
Grokking 作为结构推理:Transformer 需要贝叶斯彩票
Grokking as Structural Inference: Transformers Need Bayesian Lottery Tickets
摘要
为什么已经记住了训练集的 Transformer 在泛化之前要等待数千步?现有的解释将这种延迟归咎于范数最小化、特征出现或稀疏子网络的迟发现。这些解释捕获了转换的重要部分,但忽略了基于注意力的模型特有的约束:如果注意力丢弃了信息标记,则没有有界的下游计算可以恢复它。我们将注意力形式化为任务依赖图上的隐式贝叶斯后验,并证明泛化需要两个可分离的条件:一个熟悉的金发姑娘约束在 MLP 能力上,与基于规范的 grokking 理论相一致,以及一个新颖的贝叶斯结构条件,需要注意力在每个信息标记上放置足够的质量。这种解耦将延迟泛化解释为延迟结构推理。在训练早期,MLP 通过未对齐的特征进行记忆,使交叉熵损失接近于零,从而缺乏对结构梯度的关注。然后,在丢失的图变得可学习之前,权重衰减必须侵蚀记忆,产生已知的逆权重衰减延迟,我们将其推导出为结构等待时间。然后我们证明,这种解释性延迟可以通过基于 KL 的结构干预来绕过,从而产生一个关于摸索时间的逆干预强度缩放定律。算法序列任务的实验将结构与容量分开,并表明该贝叶斯彩票匹配或优于彩票转移。