论文
通过强化学习和并行思维扩展推理词元:竞争性编程的证据
Scaling Reasoning Tokens via RL and Parallel Thinking: Evidence From Competitive Programming
摘要
我们研究如何通过两种互补的方法来扩展推理 词元预算 以进行竞争性编程:训练时强化学习 (RL) 和测试时并行思维。在 RL 训练期间,我们观察到验证准确率与连续检查点上生成的推理标记的平均数量之间存在近似对数线性关系,并展示了两种改变此训练轨迹的方法:验证 RL 预热提高了起点,而随机裁剪在观察到的情况中产生更陡峭的趋势。由于强化学习期间的单生成推理在充分关注的情况下很快就会变得昂贵,因此我们引入了多轮并行思维管道,该管道将 词元预算 分布在线程和生成、验证和细化的轮次中。我们在此管道上端到端地训练模型,以使训练目标与测试时间结构相匹配。从 Seed-OSS-36B 开始,具有 16 个线程、每个线程 16 轮的完整系统与底层 RL 模型的 oracle pass@16 和 pass@1 相匹配,平均每个问题使用 760 万个词元,并且在 AetherCode 的 456 个硬竞争编程问题上超过了 GPT-5-high。