固定状态循环中联想回忆的剖析:匹配状态分解、干扰墙和打破它的课程
Anatomy of Associative Recall in Fixed-State Recurrences: A Matched-State Decomposition, an Interference Wall, and a Curriculum That Breaks It
摘要
据报道,固定状态循环(线性注意力和状态空间模型)在联想回忆方面落后于注意力,但整个架构的比较无法说明是哪个成分造成的。我们沿着三个单旋钮轴分解固定状态预算下的屏蔽多查询召回:短因果卷积、转换结构(等级 1 增量规则与对角线)和衰减。卷积占主导地位(在匹配训练下,两个家族的召回率约为+0.5):将无卷积细胞与配备卷积的 Mamba 进行比较,测量的是缺失的卷积,而不是重复率。在 16/32 对中,Rank-1 转换比其对角消融高出 +0.19/+0.32,但一旦两个单元都进行了卷积,裕度就会缩小到 +0.03,并且状态匹配的 Mamba-2 会与未武装的Rank-1 单元打成平手:没有任何类别声明能够幸存。解决 32 对召回问题的单元会随着负载的增加而优雅地退化,但会偶然从干扰物的大海捞针中检索 4 对——在长度和过渡上都是平坦的。稀疏监督下的干扰,而不是容量:远程课程采用从 0.021 到 1.000 的不变架构。训练是一场锁定彩票——种子要么锁定,要么不锁定——而课程就是杠杆。锁定从 1/10 上升至 7/10 (p=0.02);密集的监管不会带来任何好处;在 L=256 时,形状斜坡重新打开了统一课程无法打开的边界(4/5 与 0/9);在 L=512 时,斜坡崩溃 (0/6),将其选通到测量精度锁定在 6/6 (p=0.001)。双向降噪单元在大海捞针之前读取查询,与因果训练(十个种子)相比没有显示出可测量的优势,并且碰撞键检索需要两层。 S_5 状态跟踪护栏上的召回武装是免费的——武装单元在每个深度都明显更好 (p<=0.0044)。这些用经过衡量的分解和两种廉价的干预措施取代了“不擅长回忆的循环模型”。