论文

iCoder-27B:前沿工业编码模型的递归AI主导开发

iCoder-27B: Recursive AI-Led Development of Frontier Industrial Coding Model

智能体系统模型训练强化学习Agent HarnessRLVR

摘要

递归AI——AI在构建和改进AI中承担越来越完整角色的前景——是面向AI的AI的皇冠明珠。尽管递归自开发对小型模型、有界任务和固定时间预算已成为现实,但这一雄心更具分量的实现——开发一个可发布、具备前沿竞争力的模型——仍然困难得多。在这项工作中,我们探究多少人类参与对智能体开发前沿模型是充分的。我们把人类输入集中到一个高密度、低频次的接口:专家将目标、阶段脚手架、权限边界和操作规程编码为可复用的研究技能,而智能体实例化这些先验、选择实验、诊断结果并修订训练策略。在具有挑战性的工业编码领域,智能体演化数据并协调SFT、在线策略自蒸馏和可验证奖励的强化学习,最终产出iCoder——一个面向RTL设计和GPU内核优化的27B模型。在七个基准上,iCoder在RTLLM上领先,超越GPT-5.5和Claude-Opus-4.8;在CVDP和KernelBench L2上排名第二,超出GPT-5.5达16分;并与Claude-Opus-4.8并列TritonBench最佳。探索性案例研究进一步显示iCoder以明显更少的token进行有竞争力的迭代式RTL和GPU内核优化。这些结果绘制了一条通往递归自我改进的工程路径:人类提炼模型构建的原则,智能体通过证据驱动的实验将其落地,每一代AI成为下一代更能干的架构师。

iCoder-27B:前沿工业编码模型的递归AI主导开发:论文配图
图 1:在内核与 RTL 基准上的工业编码性能。我们在 TritonBench-G、KernelBench L2 Fast、RTLLM 和 CVDP 上将 iCoder 与领先的开源及专有模型进行比较。各基准内的柱形独立排序,分数越高越好。尽管 iCoder 仅有 27B 的紧凑规模,它在 KernelBench L2 Fast 和 CVDP 上排名第二,在 RTLLM 上位居第一,并在 TritonBench-G 上追平最佳结果。