论文

通过渐进式体验进化自我改进 大语言模型

Self-Improving Large Language Models via Progressive Experience Evolution

模型训练强化学习

摘要

能够自我完善的大语言模型(LLM)不仅需要有效的策略优化,还需要有一个原则性的机制,将短暂的交互体验转化为持久的模型能力。现有的自我改进范式仍然支离破碎:测试时方法可以显式提取经验,但无法将其内化为模型参数,而训练时优化方法可以更新模型参数,但缺乏积累可转移经验的明确机制。连接这两种范式需要一个尚未充分探索的关键中间阶段,即 \emph{experience 蒸馏}。为了解决这一差距,我们提出了 \textbf{SPEE} (\textbf{S}elf-\textbf{P}rogressive \textbf{E}xperience \textbf{E}volution),这是一个统一的 后训练 框架,它顺序执行显式体验进化,然后执行隐式策略优化。在显式体验演化过程中,SPEE 反映从多次交互中收集的轨迹,以提取、验证和逐步演化可转移的经验,随后通过特权引导的 同策略 Self-蒸馏 (OPSD) 将其内化到策略中。在隐式策略优化期间,奖励驱动的强化学习利用这些内化先验来探索新颖的解决策略。在经验演化阶段,不断发展的全局经验池整合了来自成功和失败轨迹的知识,过滤掉低效用经验,并减轻由个体轨迹引起的事后合理化。对五个数学推理基准的实验表明,SPEE 在三个模型尺度上始终优于测试时间和训练时间自我进化基线。源代码可在 https://github.com/rrrsj/SPEE 获取。