论文
Ring-Zero:将零 RL 扩展到万亿个参数以进行紧急推理
Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning
摘要
无需人工注释数据即可验证奖励的强化学习(通常称为零强化学习)已成为引发思维链推理的强大范例。然而,由于计算限制,现有的研究很大程度上仅限于小型模型,而大规模的训练动态和涌现能力尚未得到探索。为了有意义地探索这一前沿领域,我们的目标是从模型中引出高质量的推理行为。然而,我们发现幼稚的扩展通常会遇到可读性差、词元冗余和缺乏自适应推理深度的问题。为了应对这些挑战,我们提出了一个稳定高效的训练流程,结合了算法和系统优化,例如截断重要性采样、训练推理比校正和混合精度控制。我们的实验提供了三个关键发现,验证了缩放的“惨痛教训”:(1)缩放至 1T 参数显着提高了样本效率和性能上限; (2) 训练过程按顺序进行,先是初始发现阶段,然后是锐化阶段; (3)模型自发地发展出高级认知行为,包括拟人化、结构化格式化、自我验证、并行推理和情境焦虑,使得手工启发式变得多余。根据七个数学基准进行评估,Ring-2.5-1T-Zero 实现了具有竞争力的性能。此外,为了评估最终答案正确性之外的 CoT 质量,我们提出了一个跨三个维度的结构化评估框架:可理解性、可重复性和效率,其中我们的模型在生成结构化和简洁的推理轨迹方面表现出明显的优势。通过分享我们观察到的新兴现象,我们希望为社区提供对扩展行为(尤其是 1 万亿规模)的更深入见解。