论文
迭代部署提升 LLM 的规划能力
Iterative Deployment Improves Planning Skills in LLMs
摘要
我们证明,对大语言模型(LLM)进行迭代部署——每个模型都在用户从上一个模型的部署中精心整理的数据上进行微调——能够显著改变所得模型的性质。通过在多个规划领域测试这一机制,我们观察到规划能力的大幅提升,后期模型展现出涌现式泛化,能发现比初始模型长得多的规划。随后我们给出理论分析,表明迭代部署实际上在外循环中(即不作为有意的模型训练的一部分)实现了强化学习(RL)训练,并带有隐式奖励函数。与 RL 的这种联系有两个重要含义:其一,对 AI 安全领域而言,因为重复部署所蕴含的奖励函数并未被显式定义,可能对未来模型部署的性质产生意想不到的影响;其二,这里凸显的机制可被视为显式 RL 的一种替代训练机制,它依赖数据整理而非显式奖励。
