论文
IMO金牌的开放配方:Nemotron奥林匹克数学后训练
An Open Recipe for IMO Gold: Training Nemotron for Olympiad Mathematics
摘要
我们研究模型后训练和测试时推理设计如何影响高难奥林匹克数学的自然语言证明生成。从Nemotron 3 Ultra出发,通过监督微调和强化学习训练两个专用检查点,评估检查点选择、验证及修订策略。基于结果提出开放模型的测试时计算流水线,完全用自然语言工作,不使用形式证明器、外部工具或互联网。通用可用模型与两份后训练专用模型三个检查点驱动迭代搜索,生成、验证和修订候选证明,再由独立高计算阶段选择最终提交。系统在IMO 2026获得42分中的30分,达到金牌门槛。我们发布两份检查点、训练数据、训练及推理代码、提交解答,以及含200道新奥数水平问题的Nemotron-IMO-Bench。