CART:上下文锚定循环 Transformer——具有学习稳定性的参数高效架构
CART: Context-Anchored Recurrent Transformer -- A Parameter-Efficient Architecture with Learned Stability
摘要
我们提出了 CART(Context-Anchored Recurrent Transformer),这是一种参数高效的语言模型,可跨深度重用单个共享核心块 R 次。与之前在每次迭代时重新计算键值张量的循环 Transformer 不同,CART 从多层前奏中计算一次 K 和 V,并通过多头潜在注意力让循环核心交叉参与那些冻结张量。学习的线性时不变 (LTI) 门可保持递归稳定:在所有 36 个完全训练的配置中,其光谱半径稳定在窄带([0.79, 0.83] 中的 rho)内。我们分两个阶段在单个消费者 GPU 上评估 CART:3,000 个步骤的 64 配置屏幕,然后训练 30,500 个步骤(约 1B 词元)的 36 个配置(P=6,{6,8,10} 中的 R,三个种子)。 {256,512,768,1024} 中的两个模式在宽度 d 上保持不变:前奏深度 P 主导循环计数 R,并且 R 的 Stage-1 排名在完全训练时发生逆转(R=6 在 d>=512 时变得最好)。在绑定 d=1024 参数奇偶校验测试中,CART 没有击败参数匹配的密集基线,在存储参数奇偶校验时损失 1-2%,在有效参数奇偶校验时损失约 10%。诊断消融将有效参数差距分成来自权重共享的约 5% 和来自异质前奏/锚点/核心/尾声框架的剩余约 5%;循环核心机制(超连接、LTI 门、循环索引嵌入)是单独残留的。变量 R 推理在经过训练的 R 的两侧都会降级,这对于此配方下的测试时间深度缩放来说是负面结果。