论文

快速关注体重以进行持续学习

Fast Weight Attention for Continual Learning

模型架构递归架构

摘要

循环快速权重记忆和选择性状态空间模型将扩展上下文压缩为固定大小的循环状态,使状态转换成为在线学习规则。我们在写后自回归语义下研究这个规则。对于这里考虑的前缀预测目标,步骤 $t$ 中显示的本地快速记忆示例是前缀对齐对 $(\mathbf{x}_t,\mathbf{y}_t)=(φ(\mathbf{k}_{t-1}),\mathbf{v}_t)$。常见的同步关联 $(φ(\mathbf{k}_t),\mathbf{v}_t)$ 仍然是因果关系,但优化了不同的内部目标。我们导出平方误差回归和负内积目标的归一化一阶更新。回归系列包括 Falcon-1(标量 NLMS 更新)、Falcon-2(其每列扩展)和 Falcon-3(滑动窗口小批量更新); Falcon-1A/Falcon-2A/Falcon-3A 是相应的内积变体。我们提供循环、屏蔽并行和块并行形式,以及数值稳定的正衰减重整化。代表性变体在语言建模中仍然具有竞争力,并改进了可变数字加法的长度外推。该框架将循环序列模型中的时间对齐、可塑性、遗忘和有界演练分开。