论文
后训练 编程竞赛金牌表现语言模型
Post-Training Language Models for Gold-Medal Performance in Coding Competitions
摘要
竞技编程已经成为大语言模型推理的关键考验,其中IOI、ICPC等国际竞赛代表了其最具挑战性的场景。我们提出了一个端到端的专业化管道,结合了大规模问题管理、综合推理轨迹、监督 微调 (SFT) 和强化学习 (RL)。我们使用 22,000 个策划问题,使用 SFT 和 RL 训练 Nemotron-3-Nano-CC (30B-A3B),并仅使用 SFT 训练 Nemotron-3-Ultra-CC (550B-A55B)。我们进一步介绍 GenCorrect,这是一种反馈驱动的测试时计算策略,可以迭代地生成、评估和完善不同的解决方案。在 IOI 2025 上,Nano-CC 在 后训练 后从 130 分提高到 291 分,在 GenCorrect 后提高到 468 分,超过了 438.3 的金牌门槛,而 Ultra-CC 则达到了 502 分。在这些结果的指导下,我们开发了一个竞赛专用的 Ultra-CC 系统,并在 IOI 2026 期间对其进行了前瞻性评估。在与人类参赛者相同的时间、互联网接入和提交限制下,得分为 535.4(满分 600),超过了金牌门槛 361.12 和人类最高得分 498.27。据我们所知,这是第一个在 IOI 问题集上超越得分最高的人类选手的人工智能系统。