论文

从提示到曲目:不断发展的功能曲目使LLM能够持续学习

From a Prompt to Repertoires: Evolving Functional REpertoires Enable LLM Continual Learning

上下文与知识智能体系统上下文工程Agent Skills

摘要

对于大型语言模型来说,持续学习仍然具有挑战性,这必须使模型能够在不降低现有能力的情况下获得新的技能和知识。现有方法通常通过仔细设计模型参数的更新方式来解决这一挑战。相比之下,即时优化避免了代价高昂的参数更新,同时在个人知识稠密型和推理任务上实现了与强化学习方法(例如 GRPO)竞争甚至优越的性能。这就提出了一个自然的问题:\textit{提示优化作为一种​​有效的适应方法,可以直接应用于持续学习吗?}我们的分析表明,在顺序任务适应下,它会遭受灾难性遗忘,而优化的提示会积累与局部任务分布过度拟合的规则。为了解决这些限制,我们提出\emph{进化功能库}(EFRE),它将单个提示替换为随着新任务的到来而演变的功能库:兼容的更新完善了现有功能,而冲突的更新则触发 新事物的出现。在三任务持续学习流中,EFRE 的最终平均性能比 GRPO 高 7.50 个百分点。此外,在适应 Bio 任务后,其在 FinQA 上的性能仅下降了 1.56 个百分点,而基础提示优化方法的性能下降了 25.10 个百分点。我们进一步在最小代理系统中实例化 EFRE,并观察不同骨干模型之间的一致改进。总体而言,这些结果证明了 EFRE 在大型语言模型持续学习方面的强大性能,并突显了其在高级智能体系统中持续学习的巨大潜力。