论文
迈向有效的体验式学习:利用和内化的双重指导
Towards Effective Experiential Learning: Dual Guidance for Utilization and Internalization
摘要
近年来,强化学习~(RL)已成为提高大语言模型~(LLM)能力的重要方法。特别是,来自可验证奖励的强化学习(RLVR)已成为推理任务的有前途的范例。然而,现有的基于强化学习的训练仍然只是粗略地近似于人类学习。人类学习者利用外部和内部经验来指导探索,并逐渐将有用的轨迹内化为稳定的知识。出于这种差距,我们问:LLM如何更好地利用和内化RLVR训练期间的经验?为了回答这个问题,我们提出了 \textbf{D}ual \textbf{G}uidance \textbf{O}ptimization~(\textbf{DGO}),一个利用 \emph{external} 和 \emph{internal experience} 来提高训练效果的统一框架。具体来说,DGO 首先根据之前探索的轨迹构建一个经验库。然后政策在经验库和模型内部知识的共同指导下进行探索。由此产生的轨迹进一步细化经验库并优化模型参数,形成经验利用和内化的闭环。实验表明,DGO 始终优于基线方法,这表明更好地利用和内化经验可以带来更有效的推理。