论文
学习,快与慢:迈向不断适应的 LLM
Learning, Fast and Slow: Towards LLMs That Adapt Continually
摘要
大语言模型 (LLM) 通过更新其参数(例如,通过 RL)来针对下游任务进行训练。然而,更新参数迫使它们吸收特定于任务的信息,这可能导致灾难性的遗忘和可塑性的丧失。相比之下,使用固定 LLM 参数的上下文学习可以廉价且快速地适应特定于任务的要求(例如,即时优化),但其本身通常无法与通过更新 LLM 参数获得的性能增益相匹配。没有充分的理由将学习限制在上下文中或权重中。此外,人类也可能在不同的时间尺度上学习(例如,系统 1 与系统 2)。为此,我们引入了 LLM 的快慢学习框架,其中模型参数作为“慢”权重,优化上下文作为“快”权重。这些快速“权重”可以从文本反馈中学习以吸收特定于任务的信息,同时允许慢速权重更接近基本模型并持续一般推理行为。在推理任务中,快慢训练 (FST) 的样本效率比仅慢速学习 (RL) 高出 3 倍,同时始终达到更高的性能渐近线。此外,FST 训练的模型仍然更接近基本 LLM(KL 散度减少 70%),从而比 RL 训练产生更少的灾难性遗忘。这种减少的漂移还保留了可塑性:在一项任务训练后,FST 训练的模型比仅参数训练的模型更有效地适应后续任务。在任务域动态变化的持续学习场景中,FST 继续获取每个新任务,而仅参数 RL 则停止。