论文
闭环:循环语言模型的实用训练秘诀
Closing the Loop: Practical Training Recipes for Looped Language Models
摘要
循环语言模型通过重复应用共享的层块来增加有效深度,但现有的大规模配方需要对数万亿个词元进行多阶段训练,而循环的好处仍然很难与数据和训练的差异分开。在这项工作中,我们为循环语言模型建立了实用的训练方法,取得了三个主要结果。 (1) 我们开发了一种计算高效的从头开始的管道,将 Ouro 中的训练预算从 7.7T 词元减少到 310B 词元,同时保持强大的推理性能。预训练和高质量的中期训练,再加上学习率预热和更强的退出门正则化,可以实现稳定的循环训练,而无需事先进行多阶段计划。 (2) 在受控比较下,我们的 1.4B LoopLM 在所有 12 个评估基准上都优于在相同数据和词元预算上训练的参数匹配密集模型,包括 GSM8K 上的 +14 分、MATH 上的 +10 分和 DROP 上的 +22 分。在匹配推理计算中,它在数学推理和阅读理解方面接近 3.9B 密集模型,同时仅使用 36% 的参数。 (3) 我们引入了将预训练密集模型转换为循环模型的最小方法:单个学习的输入混合标量和平滑的退出损失,没有特定于步骤的参数。应用于 Qwen3-1.7B-Base 时,Looped Qwen 在两个数据机制的每个评估基准上都在相同的连续密集基线上进行了改进,在 GSM8K、MATH 和 MMLU-Pro 上精选的混合物上有统计上明显的增益。总之,这些结果使得循环语言模型从头开始训练的成本大大降低,并且可以实用地引入到现有的预训练检查点中,同时隔离由于递归本身带来的收益。