论文
循环自我改进:循环语言模型的动态跨循环同策略蒸馏
Recurrent Self-Improvement: Dynamic Cross-Loop On-Policy Distillation for Looped Language Models
摘要
循环语言模型 (LoopLM) 通过在循环计算步骤中重用共享参数,提供了一种参数有效的扩展推理方法。尽管他们做出了承诺,但 LoopLM 的有效后训练仍然具有挑战性。现有的方法要么提供基于奖励的监督,这种监督稀疏或跨循环扩展成本高昂,要么依赖外部教师或特权信息,导致教师可用性有限或师生上下文不匹配。为了解决这些限制,我们引入了 LoopOPD,这是一种跨循环同策略蒸馏框架,它使用 LoopLM 内的额外循环计算作为其自己的监督源。 LoopOPD 使用冻结终端循环策略作为学生生成的部署中的中间循环学生的计算特权教师,无需外部教师或特权信息即可提供密集监督。我们进一步提出动态 LoopOPD(D-LoopOPD),它随着共享模型参数的更新而不断刷新终端循环教师,从而实现循环的自我改进。我们描述如何 蒸馏更新在循环深度上传播,并得出充分的条件,在该条件下,单个更新在两个循环深度上同时产生局部改进。 Ouro-Thinking 模型的实验表明,LoopOPD 改善了数学推理,而 D-LoopOPD 通过动态教师更新获得了进一步的收益。尽管只接受了数学数据的训练,但生成的模型也改进了一般推理和代码生成基准,证明循环计算可以作为 LoopLM 的有效监督来源。我们的代码和模型检查点将在接受后发布。