论文

迭代部署提升 LLM 的规划能力

Iterative Deployment Improves Planning Skills in LLMs

模型训练持续学习

摘要

我们证明,对大语言模型(LLM)进行迭代部署——每个模型都在用户从上一个模型的部署中精心整理的数据上进行微调——能够显著改变所得模型的性质。通过在多个规划领域测试这一机制,我们观察到规划能力的大幅提升,后期模型展现出涌现式泛化,能发现比初始模型长得多的规划。随后我们给出理论分析,表明迭代部署实际上在外循环中(即不作为有意的模型训练的一部分)实现了强化学习(RL)训练,并带有隐式奖励函数。与 RL 的这种联系有两个重要含义:其一,对 AI 安全领域而言,因为重复部署所蕴含的奖励函数并未被显式定义,可能对未来模型部署的性质产生意想不到的影响;其二,这里凸显的机制可被视为显式 RL 的一种替代训练机制,它依赖数据整理而非显式奖励。

迭代部署提升 LLM 的规划能力 配图
图 1:用于规划的迭代部署机制的单次迭代。使用一组固定的规划任务,我们提示当前版本的 LLM——即模型的第 n 代——来解决这些任务。外部验证器(例如使用聊天机器人的人类,或在规划情形下的计算机程序)识别出被正确解决的任务。这些任务的轨迹与规划,连同此前各代所解决任务的轨迹与规划,随后被用于微调第 n 代,从而产生模型的第 n+1 代。