论文
GrandCode:通过智能体强化学习在竞技编程中达到特级大师水平
GrandCode: Achieving Grandmaster Level in Competitive Programming via Agentic Reinforcement Learning
摘要
竞技编程仍然是编程领域人类对抗AI的最后几个堡垒之一。迄今最好的AI系统在竞技编程上仍不及最顶尖的人类:最近的最佳成绩是Google的Gemini 3 Deep Think获得第8名,而且这甚至不是在实时比赛条件下评估得出的。在本工作中,我们提出GrandCode,一个为竞技编程设计的多智能体强化学习(RL)系统。GrandCode的能力归因于两个关键因素:(1)它编排了多种智能体模块(假设提出、求解器、测试生成器、总结等),并通过后训练与在线测试时RL联合改进它们;(2)我们提出了专为具有延迟奖励和智能体RL中普遍存在的严重离策略漂移的多阶段智能体rollout设计的Agentic GRPO。GrandCode是首个在竞技编程实时比赛中稳定击败所有人类参赛者的AI系统:在最近的三场Codeforces实时比赛,即Round 1087(2026年3月21日)、Round 1088(2026年3月28日)和Round 1089(2026年3月29日)中,GrandCode全部排名第一,击败了包括传奇特级大师在内的所有人类参赛者。GrandCode表明,AI系统已达到在最具竞争性的编程任务上超越最强人类程序员的地步。
