论文

语言模型需要睡眠吗?离线重现以改进在线推理

Do Language Models Need Sleep? Offline Recurrence for Improved Online Inference

摘要

基于 Transformer 的 大语言模型 越来越多地用于长视野任务;然而,他们的注意力机制与上下文长度的关系很差。为了解决这个问题,我们研究了一种类似睡眠的整合机制,其中模型在清除其键值缓存之前定期将最近的上下文转换为持久的快速权重。在睡眠期间,模型对累积的上下文执行 $N$ 离线循环传递,并通过学习的本地规则更新其状态空间模型 (SSM) 块中的快速权重。在推理过程中,这会将额外的计算转移到睡眠状态,同时保留唤醒时间预测的延迟。我们在受控合成任务上测试我们的方法,包括细胞自动机和多跳图检索,以及现实的数学推理任务,常规 Transformer 和 SSM-attention 混合模型在这些任务上都失败了。然后,我们表明,增加模型的睡眠持续时间 $N$ 可以提高性能,在需要更深入推理的示例中收益最大。