论文
语言模型预训练中不断变化的块旁路响应中的持续深度排序
Persistent Depth Ordering amid Shifting Block-Bypass Responses in Language Model Pretraining
摘要
层干预被广泛用于探测语言模型的内部组织,但大多数分析都会检查单个训练检查点,即使模型表示和计算在整个预训练过程中不断发展。这就留下了哪些依赖于深度的干预反应反映了持久的组织,哪些是训练的短暂后果。我们在固定的教师强制上下文上使用单块身份旁路来研究这个问题,跨五个发布的轨迹和 11 个模型域组合。我们发现块旁路响应保留了可识别的深度排序,同时其大小重新分布:附近的检查点比远处的检查点保留更强的等级对应关系,并且大的变化集中在跨文本样本重复出现并跨评估域转移的位置。对照实验进一步表明,自然旁路效应的变化不能减少到单个下游敏感性:在复制的 Pythia 运行中,局部缺失更新幅度增加,而合并的匹配下游响应减少,而 OLMo-2 7B 表现出不同的平衡。这些匹配的响应还取决于扰动强度和方向,而无需确定目标补偿。总之,我们的结果表明,纵向层敏感性是结构化的,但不是静态的,并且单检查点干预反应应该在训练期间潜在扰动路径如何演变的背景下进行解释。