论文

语言模型需要睡眠:学习自我修改和巩固记忆

Language Models Need Sleep: Learning to Self-Modify and Consolidate Memories

模型训练持续学习

摘要

过去几十年见证了机器学习算法设计的重大进步,从早期对特定任务浅层模型的研究到更通用的深层 大语言模型 (LLM)。尽管在需要即时预测或上下文学习的任务中显示出有希望的结果,但现有模型缺乏持续学习和有效地将其时间上下文知识转移到长期参数的能力。受人类学习过程的启发,我们引入了“睡眠”范式,允许模型不断学习,通过重播将其短期脆弱记忆提炼成稳定的长期知识,并通过“做梦”过程递归地改进自己。更详细地说,睡眠由两个阶段组成:(1)记忆巩固:一个向上的 蒸馏 过程,称为知识播种,其中较小自我的记忆被提炼到更大的网络中,以提供更多容量,同时保存知识。作为概念证明,我们提出了一种用于{知识播种}的新广义 蒸馏 流程(即 同策略 蒸馏 与基于强化学习 (RL) 的模仿学习的组合); (2) 梦想:自我完善阶段,模型使用强化学习生成合成数据课程,以在没有人类监督的情况下演练新知识并完善现有能力。我们对长期、持续学习、知识整合和小样本泛化任务的实验支持了睡眠阶段的重要性。