论文
Transformer 层之间的持久循环内存 - 改进语言模型泛化
Persistent Recurrent Memory Between Transformer Layers - Improves Language Model Generalization
摘要
我们对仅解码器的转换器进行了简单的架构修改:持久的循环状态,通过交叉注意力观察隐藏表示,通过 GRU 更新自身,并通过门控加法调节后续处理。该模块插入 6 层Transformer的下半部和上半部之间,仅添加 3.7% 的额外参数,同时将评估损失从 $2.438 \pm 0.004$ 降低到 $1.743 \pm 0.018$,相当于保留的语言建模数据减少了 28.5\%。该改进在 5 个随机种子中具有统计显着性 ($p < 0.01$),并且对应于过度拟合的减少(泛化差距 0.12 与 0.26)。通过受控消融,我们证明了这种改进完全源于持久内存拓扑,而不是辅助自我预测目标。具有相同拓扑但没有辅助损失的模型表现相同,而随机辅助损失则没有任何好处。表征探测表明,持久状态编码叙事位置(52% vs 33% 机会水平)——标准注意力维持效率较低的信息。我们的结果表明,用轻量级循环存储器桥接转换器层是提高小规模语言模型泛化能力的一种简单有效的方法。