论文
滞后耦合:内部表示在成为因果关系之前变得可读
Lagged Coupling: Internal Representations Become Readable Before They Become Causal
摘要
在整个 Pythia 套件(160M-12B、8 个检查点、4 个任务系列)中,线性探针可以在每个尺度上早在步骤 1,000 时从残差流中读取目标变量,但沿着相同读取方向的转向在 48 个模型检查点单元中的 43 个中保持零等价。内部可读性系统性地超过了因果效力,并且滞后性并没有随着规模的扩大而缩小。我们称这种结构为滞后耦合,并将其分解为三个可分离的轨道:(i)内部可读性,从第一个检查点开始饱和(AUROC >= 0.990); (ii) 行为可读性,在更大的尺度上逐渐发展(12B 仅在最终检查点达到 0.909); (iii) 因果功效,几乎总是零等价,偶尔会在早期产生反作用,有一个孤立的正脉冲(12B,步骤 8,000,z = +2.49),我们的网格无法解析。顺序主要是先读后写(11/11 单位,无反转)。通过训练和缩放,沿探测方向的表示余量增长至 57 倍,而因果写入保持在余量的 0.11% 以下——变量越来越多地写入表示中,并越来越多地被读出忽略。在完全预先注册的协议下,两个单次假设都解决了不确定(尺度斜率+0.24,95%CI [-0.60,+0.87];时间投票3:3)——通过三轨分解解释的严格否定。预先注册的 OLMo-2 复制保留了衰减幅度的方向。我们的结果警告不要从探测精度推断可操纵性,并建立了一个发展瓶颈:表示形成可靠地超过了因果读数整合。