论文
DeltaTTT:非线性循环记忆的分层优化
DeltaTTT: Layerwise Optimization for Nonlinear Recurrent Memory
摘要
顺序测试时训练 通过连续更新来适应记忆网络,每次更新都根据网络的先前状态计算内循环梯度。直观上,这种状态依赖性应该允许每次更新都考虑到记忆已经学到的内容并更好地合并新信息。然而,我们发现这种预期的优势在非线性记忆中并没有始终如一地实现:固定基并行 TTT 基线优于其串行对应基线。我们的探索性实验指出了一个关键的潜在困难:在序列的单次传递中,非线性记忆比线性记忆更难优化。为了缓解这种优化困难,我们引入了 DeltaTTT,它用分层学习代替了两层记忆网络的联合内循环优化。每层都分配有一个本地预测目标,并通过状态相关的增量规则进行更新。该公式保留了非线性 读出,同时支持分块并行计算。 DeltaNet 和 LaCT 骨干模型 上的实验表明,语言建模和检索相对于其循环基线有所改进。
