论文
进化系统即时学习可以促进大语言模型的强化学习
Evolutionary System Prompt Learning can Facilitate Reinforcement Learning for LLMs
摘要
构建能够根据经验自主自我改进的代理系统是人工智能的长期目标。如今,大语言模型 (LLM) 主要通过两种机制进行自我改进:用于上下文更新的自我反思和用于权重更新的强化学习 (RL)。在这项工作中,我们提出了进化系统即时学习(E-SPL),这是一种联合改进模型上下文和模型权重的方法。在每次 RL 迭代中,E-SPL 选择多个系统提示并并行运行每个提示。它将 RL 更新应用于以每个系统提示为条件的模型权重,并通过 LLM 驱动的突变和交叉对系统提示群体进行进化更新。每个系统提示都有一个用于进化选择的 TrueSkill 评级,根据每个 RL 迭代批次内的相对表现进行更新。 E-SPL 鼓励在提示中编码的声明性知识和在权重中编码的程序性知识之间进行自然划分,从而提高推理和代理任务的性能。例如,在从易到难(AIME $\rightarrow$ BeyondAIME)泛化设置中,E-SPL 将 RL 成功率从 38.8% $\rightarrow$ 提高到 45.1%,同时也优于反射提示进化 (40.0%)。总的来说,我们的结果表明,将强化学习与系统即时进化相结合可以在样本效率和泛化方面产生一致的收益。代码:https://github.com/LunjunZhang/E-SPL
