论文

持续学习什么时候需要学习

When Does Continual Learning Require Learning

模型评测评测方法与指标

摘要

随着 大语言模型 (LLM) 的能力越来越强,下一个问题是我们如何使模型能够持续学习?如今,该领域很大程度上将其视为上下文管理和减轻遗忘的问题。我们认为这个框架是不完整的:持续学习从根本上讲是随着世界的变化而提高模型能力。我们沿着两个轴解开这种变化:空间(模型遇到新领域)和时间(底层数据在固定任务下漂移)。这个框架让我们能够在现实条件下研究持续学习:随着时间的推移,新的领域到来,事实超出了训练界限,代理交互在各个事件中积累状态。为了评估这种设置下的方法,我们将广泛使用的 LLM 基准重新定义为顺序问题,并引入一个与机制无关的协议,该协议比较基于提示的方法(GEPA、ACE)、监督学习(SFT、SDFT)、强化学习(GRPO、SDPO)和上下文压缩(Cartridges、In-place TTT)。基于提示的方法可以快速适应每个新阶段,但会降低未来任务的性能。基于 蒸馏 的方法可以稳定地积累知识,但很难更新过时的事实。上下文压缩提高了效率,但并没有显着提高学习新任务的能力。在线强化学习最有效地适应知识更新,但对嘈杂的奖励信号仍然敏感。总的来说,我们的结果表明,持续学习不是单一的能力:不同的环境变化模式需要根本不同的更新行为,决定何时必须在模型权重内学习适应以及何时可以通过外部支架来实现。我们希望了解每种方法的成功和失败之处将指导更强大的持续学习系统的设计。