论文

通过简单统一的扩展实现金牌级奥赛推理

Achieving Gold-Medal-Level Olympiad Reasoning via Simple and Unified Scaling

模型训练强化学习RLVR

摘要

推理模型的最新进展已大幅推进了长程数学与科学问题求解,若干系统现已在国际数学奥林匹克(IMO)和国际物理奥林匹克(IPhO)题目上达到金牌级表现。本文提出一个简单统一的配方,用于将后训练的推理骨干转化为严谨的奥赛级求解器。该配方首先在SFT中使用反向困惑度课程以灌输严谨的证明搜索与自检行为,随后通过一个两阶段RL流水线扩展这些行为——从可验证奖励的RL过渡到更精细的证明级RL,最后用测试时扩展提升解题性能。应用这一配方,我们训练了一个30B-A3B骨干,先在约340K条低于8K词元的轨迹上做SFT,随后进行200步RL。由此得到的模型SU-01能够在轨迹超过100K词元的困难问题上稳定推理,并在数学和物理奥赛中获得金牌级表现,包括IMO 2025/USAMO 2026和IPhO 2024/2025。它还展现出科学推理向数学和物理之外领域的强泛化能力。

通过简单统一的扩展实现金牌级奥赛推理:论文配图
图 2:SU-01 训练和推理管道概述。该配方首先使用严格的长格式 SFT 重塑主干,然后通过粗略和细化的 RL 来扩展结果行为,最后应用测试时验证和细化来解决奥林匹克级别的问题。