论文

Natural Ungrokking:对哪些规则在预训练中幸存的不对称控制

Natural Ungrokking: Asymmetric Control of Which Rules Survive Pretraining

模型评测模型行为与机制分析

摘要

在普通预训练运行的中途,一个小型语言模型学习代词性别规则:根据一个女孩的名字(“Sue 哭了,因为”)提示,它将下一个代词解析为 she,并推广到保留的探针(0.94,步骤 925)。到了第 3,500 步,尽管该规则的证据仍在训练数据中,但相同的模型在相同的探测上得分接近于零。我们将这种运行内反转称为自然 ungrokking:语料库决定,在损失曲线中没有任何痕迹,模型保留了学习的规则。哪些规则能够生存下来,可以通过一项语料库统计数据来预测:训练流显示规则获胜的频率。在未干预的运行中(两个语料库、三个预算、三个种子),支持频率决定了规则的命运;数据与参数的比率仅调节注定规则的下降程度。同样的出现-然后崩溃动态出现在公共 Pythia 检查点中,崩溃深度按照预测的模型规模排序。遗忘是一种位移:竞争的表面模式胜过规则,并且它们之间的对数概率裕度在行为崩溃的 100 个训练步骤内过零。对这种命运的控制是不对称的:按需破坏规则的同一编辑无法恢复它。将支持转向现有的反证据会杀死两条不相关规则中单调剂量反应的规则;但注入支撑,即使是自然维持水平的 450 倍,也买不到复苏。每个确认阈值和预测都在读取其管辖的数据之前预先注册。