论文
先竞争后协作:前沿AI教师构建可验证课程使编码学生超越模仿
Compete Then Collaborate: Frontier AI Teachers Build a Verifiable Curriculum to Improve a Coding Student Beyond Imitation
摘要
大语言模型日益充当为更小学生生成训练数据的教师。既往多教师知识蒸馏方法合并输出而不判定哪个前沿模型教得最好——常依赖偏向自身输出的LLM裁判。我们引入先竞争后协作框架:四个前沿AI教师(Claude、Codex-GPT、Grok、Gemini)由执行型裁判(单元测试与stdin-stdout检查)配公平控制头对头排名,然后协作构建为学生(Qwen2.5-Coder)的可验证课程。我们报告三个发现。(1) 在执行验证下:所有教师在自纠后近完美解决标准问题(99–100%,饱和效应),但更难的竞赛题区分它们(Gemini 77% > Claude 69% = Codex 69% > Grok 50%);不过学生侧的鲁棒结果不依赖教师排名。(2) 对经验证的解做模仿(SFT)不能改善、反而可能退化已有能力的7B/32B学生(如MBPP-test从76.7%降到72.7%,竞赛题从5.9%到2.9%)。(3) 把同一协作课程用作可验证奖励强化学习(RLVR)环境改善学生(竞赛题峰值从5.9%到8.8%、相对增益+49%)——反转SFT的方向。AI教师协作的价值不在汇集答案供模仿,而在共同构建学生通过做而学习的可验证环境。我们发布可复现的本地管线(NVIDIA GB10)与在最前沿栈上运行GRPO的框架补丁。